{}const=>[]async()letfn</>var
開発

指先のデータサイエンス:簡単な例でデータ分析を学ぶ

平均チェックの計算方法、ファネル内のボトルネックの検索方法、複雑な数式なしで仮説を検証する方法など、シンプルでわかりやすい例を使用してデータサイエンスを分析します。統計の魔法ではなく、論理的に、人間的にすべてを理解します。

К

Kodik

著者

1分で読める

そもそもデータサイエンスはなぜ必要なのでしょうか?

データサイエンスは「AIマジック」ではなく、データに対する正確な質問です。

  • 何が起こっているのですか? — 説明的分析

  • なぜこのようなことが起こるのでしょうか? — 診断

  • 今後の展望 — 予報

  • どうすればいいですか? — おすすめ

基本サイクル:収集→整理→観察(EDA)→仮説検証→モデル化→結果の説明と意思決定。

ルール1:結果は行動につながるべきです。数字のための数字は無駄です。

🔥 10万人以上の学生が参加中

理論を読むのに疲れた?
コーディングの時間だ!

Kodik — 実践でプログラミングを学ぶアプリ。AIメンター、インタラクティブなレッスン、実際のプロジェクト。

🤖 AI 24時間
🎓 修了証
💰 無料
🚀 始める
今日参加

ミニチートシート:何を考慮し、何を測定するか

質問

計算方法

ツール

メトリックの種類

意味

顧客はどれくらいの金額を費やしていますか?

平均チェック (mean)、中央値

Pandas/SQL

記述的

収益の基本的な目安

需要はどの程度「生きて」いますか?

コンバージョン、購入頻度

グループ、コホート

記述的/診断的

ファネルを理解する

バナーは機能していますか?

Δコンバージョン、tテスト/ブートストラップ

SciPy/ブートストラップ

情報統計

効果が偶然ではない可能性

反応に影響を与えるものは何ですか?

相関関係/機能の重要性

corr (),単純回帰

診断

どのような要因が本当に重要か

明日はどれくらい売れますか?

予測(線形/木)

scikit-learn

予測

購買・広告の最適化

例1.コーヒーショップと平均チェック

シナリオ: オーナーは、なぜ収益が「跳ね上がる」のかを理解したいと考えています。

データ: テーブル orders (id、日付、金額、支払い方法)。

私たちがしていること:

  1. 計算 平均チェック中央値.

  2. 建設中 レシートの配布.

  3. 見てみましょう 曜日 — ピーク日は?

df['weekday'] = df['date'].dt.day_name()
avg_check = df['amount'].mean()
median_check = df['amount'].median()
by_weekday = df.groupby('weekday')['amount'].mean().sort_values(ascending=False)

結論: 平均チェック >> メジアン — 高額注文の「テール」が長い場合。金曜日のピーク?つまり、木曜日の夜にプロモーションを開始することをお勧めします。

例2.閲覧から購入へのコンバージョン

シナリオ: オンラインストア:ビュー数が多く、購入数が少ない。

データ: イベント view_productpurchaseuser_id.

views = events.query('event=="view_product"').user_id.nunique()
carts = events.query('event=="add_to_cart"').user_id.nunique()
buys  = events.query('event=="purchase"').user_id.nunique()
conv_view_to_cart = carts / views
conv_cart_to_buy  = buys / carts

結論: 「カート→購入」ステージで収益が減少している場合は、UX、フォームのエラー、または配送コストを確認してください。

例3:バナーのクイックA/Bテスト

from statsmodels.stats.proportion import proportions_ztest
count = np.array([buys_B, buys_A])
nobs  = np.array([visits_B, visits_A])
stat, p = proportions_ztest(count, nobs)

結論: +0.8 p.p.の差でも、信頼区間とトラフィックのコストを考慮する必要があります。

例4.「明日の」売上予測

X = pd.get_dummies(df[['day_index','weekday']], drop_first=True)
y = df['sales']
model.fit(X_train, y_train)
pred = model.predict(X_test)
mae = np.mean(np.abs(pred - y_test))

結論: 予測は、不確実性を減らすために必要であり、「正確な推測」のためではありません。

例 5. 実際に反応に影響を与えるものは何か?

シナリオ: メールマガジン。一部のメールは開封され、他のメールは開封されないのはなぜですか?

アイデア: 特徴の影響を評価するために相関とロジスティック回帰を確認します。

データのクリーニングは成功の半分です

問題

気づく方法

対処法

スキップ

df.isna().mean()

削除または中央値に置き換える

排出量

Boxplot, z-score

ビジネスルールで制限する

複製

df.duplicated().sum()

キーをクリアする

さまざまな日付形式

解析エラー

to_datetimeを使用する

不完全なカテゴリ

割合 < 1%

「その他」に統合する

B コディケ Pythonとアナリティクスの短いモジュールを提供し、CSVの読み込み、クリーニング、ファネル、ミニA/Bテスト、最初のモデルなどの「実際の」タスクを実行します。水なしで、わかりやすい結果。

また、アクティブな テレグラムチャンネル、ここでは素晴らしいアイデアについて話し合い、経験を共有し、課題を一緒に分析します。学習は有益であるだけでなく、楽しいものになります。

🎯先延ばしをやめよう

記事は気に入った?
実践の時間だ!

Kodikでは読むだけでなく、すぐにコードを書く。理論 + 実践 = 本当のスキル。

即座に実践
🧠AIがコードを説明
🏆修了証

登録不要 • カード不要