{}const=>[]async()letfn</>var
Entwicklung

Data Science leicht gemacht: Datenanalyse anhand einfacher Beispiele

Lassen Sie uns Data Science anhand einfacher und anschaulicher Beispiele analysieren — wie man den durchschnittlichen Scheck berechnet, nach Engpässen im Trichter sucht und Hypothesen ohne komplexe Formeln testet. Alles auf menschliche Weise, mit Logik, nicht mit der Magie der Statistik.

К

Kodik

Autor

3 Min. Lesezeit

Warum eigentlich Data Science?

Data Science ist keine „KI-Magie“, sondern sorgfältige Fragen an die Daten:

  • Was ist los? — beschreibende Analytik

  • Warum passiert das? — Diagnostik

  • Was wird als nächstes passieren? — Prognose

  • Was tun? — Empfehlungen

Grundzyklus: sammeln → bereinigen → ansehen (EDA) → Hypothese prüfen → modellieren → Ergebnis erklären und Entscheidung treffen.

Regel Nr. 1: Das Ergebnis muss zu einer Handlung führen. Zahlen um der Zahlen willen sind Müll.

🔥 100.000+ Schüler sind bereits bei uns

Genug Theorie gelesen?
Zeit zu coden!

Kodik — eine App, in der du durch Praxis programmieren lernst. KI-Mentor, interaktive Lektionen, echte Projekte.

🤖 KI 24/7
🎓 Zertifikate
💰 Kostenlos
🚀 Jetzt starten
Heute beigetreten

Mini-Spickzettel: Was zu zählen und womit zu messen ist

Frage

Was wir denken

Werkzeug

Metriktyp

Was bedeutet

Wie viel geben Kunden aus?

Durchschnittliche Rechnung (Mittelwert), Median

Pandas/SQL

Beschreibend

Grundlegende Einnahmenrichtlinie

Wie „lebendig“ ist die Nachfrage?

Konversion, Kaufhäufigkeit

Gruppen, Kohorten

Beschreibend/diagnostisch

Den Trichter verstehen

Funktioniert das Banner?

Δ Umwandlung, t-Test/Bootstrap

SciPy/Bootsrap

Inf. Statistik

Die Wahrscheinlichkeit, dass der Effekt kein Zufall ist

Was beeinflusst die Resonanz?

Korrelationen / Feature-Bedeutung

corr(), einfache Regression

Diagnostik

Welche Faktoren sind wirklich wichtig?

Wie viel verkaufen wir morgen?

Prognose (linear / Bäume)

scikit-learn

Prognose

Wir optimieren Einkauf/Werbung

Beispiel 1. Café und durchschnittlicher Kassenbon

Szenario: Der Eigentümer möchte verstehen, warum der Umsatz „springt“.

Daten: Tabelle orders (ID, Datum, Betrag, Zahlungsmethode).

Was wir tun:

  1. Wir berechnen Durchschnittlicher Rechnungsbetrag und Median.

  2. Wir bauen Verteilung der Belege.

  3. Wir schauen Wochentag — Wo sind die Spitzentage?

df['weekday'] = df['date'].dt.day_name()
avg_check = df['amount'].mean()
median_check = df['amount'].median()
by_weekday = df.groupby('weekday')['amount'].mean().sort_values(ascending=False)

Schlussfolgerungen: Wenn der durchschnittliche Scheck >> dem Median entspricht, haben Sie einen langen „Schwanz“ teurer Bestellungen. Spitzen am Freitag? Dann ist es besser, die Aktion am Donnerstagabend zu starten.

Beispiel 2. Konversion von der Ansicht zum Kauf

Szenario: Online-Shop: viele Aufrufe, wenige Einkäufe.

Daten: Ereignisse view_product und purchase mit user_id.

views = events.query('event=="view_product"').user_id.nunique()
carts = events.query('event=="add_to_cart"').user_id.nunique()
buys  = events.query('event=="purchase"').user_id.nunique()
conv_view_to_cart = carts / views
conv_cart_to_buy  = buys / carts

Fazit: Wenn der Verlust in der Phase "Warenkorb → Kauf" auftritt, überprüfen Sie UX, Formfehler oder Versandkosten.

Beispiel 3. Schneller A/B-Test eines Banners

from statsmodels.stats.proportion import proportions_ztest
count = np.array([buys_B, buys_A])
nobs  = np.array([visits_B, visits_A])
stat, p = proportions_ztest(count, nobs)

Fazit: Auch bei einer Differenz von +0,8 Prozentpunkten sollten das Konfidenzintervall und die Traffic-Kosten berücksichtigt werden.

Beispiel 4. Verkaufsprognose „für morgen“

X = pd.get_dummies(df[['day_index','weekday']], drop_first=True)
y = df['sales']
model.fit(X_train, y_train)
pred = model.predict(X_test)
mae = np.mean(np.abs(pred - y_test))

Fazit: Eine Prognose ist notwendig, um die Unsicherheit zu verringern, nicht um „genau zu erraten“.

Beispiel 5. Was beeinflusst die Antwort wirklich?

Szenario: E-Mail-Newsletter. Warum werden manche E-Mails geöffnet und andere nicht?

Idee: Korrelationen und logistische Regressionen überprüfen, um den Einfluss von Merkmalen zu bewerten.

Datenbereinigung ist die halbe Miete

Problem

Wie man es bemerkt

Was tun?

Ausfälle

df.isna().mean()

Löschen oder durch Median ersetzen

Emissionen

Boxplot, z-score

Nach Geschäftsregeln einschränken

Duplikate

df.duplicated().sum()

Schlüssel löschen

Verschiedene Datumsformate

Fehler beim Parsen

to_datetime verwenden

Unvollständige Kategorien

Anteil < 1%

In „Andere“ zusammenfassen

In Kodike Wir bieten kurze Module zu Python und Analytik mit realen Aufgaben – CSV-Upload, Reinigung, Trichter, Mini-A/B-Test und erstes Modell. Ohne Wasser und mit klaren Ergebnissen.

Und wir haben auch einen aktiven Telegram-Kanal, wo wir coole Ideen diskutieren, Erfahrungen teilen und Aufgaben gemeinsam analysieren — Lernen wird nicht nur nützlich, sondern auch unterhaltsam.

🎯Hör auf zu zögern

Artikel gefallen?
Zeit zum Üben!

Bei Kodik liest du nicht nur — du schreibst sofort Code. Theorie + Praxis = echte Skills.

Sofortige Praxis
🧠KI erklärt Code
🏆Zertifikat

Keine Registrierung • Keine Karte