そもそもデータサイエンスはなぜ必要なのでしょうか?
データサイエンスは「AIマジック」ではなく、データに対する正確な質問です。
何が起こっているのですか? — 説明的分析
なぜこのようなことが起こるのでしょうか? — 診断
今後の展望 — 予報
どうすればいいですか? — おすすめ
基本サイクル:収集→整理→観察(EDA)→仮説検証→モデル化→結果の説明と意思決定。
ルール1:結果は行動につながるべきです。数字のための数字は無駄です。
ミニチートシート:何を考慮し、何を測定するか
質問 | 計算方法 | ツール | メトリックの種類 | 意味 |
|---|---|---|---|---|
顧客はどれくらいの金額を費やしていますか? | 平均チェック (mean)、中央値 | Pandas/SQL | 記述的 | 収益の基本的な目安 |
需要はどの程度「生きて」いますか? | コンバージョン、購入頻度 | グループ、コホート | 記述的/診断的 | ファネルを理解する |
バナーは機能していますか? | Δコンバージョン、tテスト/ブートストラップ | SciPy/ブートストラップ | 情報統計 | 効果が偶然ではない可能性 |
反応に影響を与えるものは何ですか? | 相関関係/機能の重要性 | corr (),単純回帰 | 診断 | どのような要因が本当に重要か |
明日はどれくらい売れますか? | 予測(線形/木) | scikit-learn | 予測 | 購買・広告の最適化 |
例1.コーヒーショップと平均チェック
シナリオ: オーナーは、なぜ収益が「跳ね上がる」のかを理解したいと考えています。
データ: テーブル orders (id、日付、金額、支払い方法)。
私たちがしていること:
計算 平均チェック と 中央値.
建設中 レシートの配布.
見てみましょう 曜日 — ピーク日は?
df['weekday'] = df['date'].dt.day_name()
avg_check = df['amount'].mean()
median_check = df['amount'].median()
by_weekday = df.groupby('weekday')['amount'].mean().sort_values(ascending=False)
結論: 平均チェック >> メジアン — 高額注文の「テール」が長い場合。金曜日のピーク?つまり、木曜日の夜にプロモーションを開始することをお勧めします。

例2.閲覧から購入へのコンバージョン
シナリオ: オンラインストア:ビュー数が多く、購入数が少ない。
データ: イベント view_product と purchase と user_id.
views = events.query('event=="view_product"').user_id.nunique()
carts = events.query('event=="add_to_cart"').user_id.nunique()
buys = events.query('event=="purchase"').user_id.nunique()
conv_view_to_cart = carts / views
conv_cart_to_buy = buys / carts
結論: 「カート→購入」ステージで収益が減少している場合は、UX、フォームのエラー、または配送コストを確認してください。
例3:バナーのクイックA/Bテスト
from statsmodels.stats.proportion import proportions_ztest
count = np.array([buys_B, buys_A])
nobs = np.array([visits_B, visits_A])
stat, p = proportions_ztest(count, nobs)
結論: +0.8 p.p.の差でも、信頼区間とトラフィックのコストを考慮する必要があります。
例4.「明日の」売上予測
X = pd.get_dummies(df[['day_index','weekday']], drop_first=True)
y = df['sales']
model.fit(X_train, y_train)
pred = model.predict(X_test)
mae = np.mean(np.abs(pred - y_test))
結論: 予測は、不確実性を減らすために必要であり、「正確な推測」のためではありません。
例 5. 実際に反応に影響を与えるものは何か?
シナリオ: メールマガジン。一部のメールは開封され、他のメールは開封されないのはなぜですか?
アイデア: 特徴の影響を評価するために相関とロジスティック回帰を確認します。
データのクリーニングは成功の半分です
問題 | 気づく方法 | 対処法 |
|---|---|---|
スキップ |
| 削除または中央値に置き換える |
排出量 | Boxplot, z-score | ビジネスルールで制限する |
複製 |
| キーをクリアする |
さまざまな日付形式 | 解析エラー |
|
不完全なカテゴリ | 割合 < 1% | 「その他」に統合する |
B コディケ Pythonとアナリティクスの短いモジュールを提供し、CSVの読み込み、クリーニング、ファネル、ミニA/Bテスト、最初のモデルなどの「実際の」タスクを実行します。水なしで、わかりやすい結果。
また、アクティブな テレグラムチャンネル、ここでは素晴らしいアイデアについて話し合い、経験を共有し、課題を一緒に分析します。学習は有益であるだけでなく、楽しいものになります。
