Warum eigentlich Data Science?
Data Science ist keine „KI-Magie“, sondern sorgfältige Fragen an die Daten:
Was ist los? — beschreibende Analytik
Warum passiert das? — Diagnostik
Was wird als nächstes passieren? — Prognose
Was tun? — Empfehlungen
Grundzyklus: sammeln → bereinigen → ansehen (EDA) → Hypothese prüfen → modellieren → Ergebnis erklären und Entscheidung treffen.
Regel Nr. 1: Das Ergebnis muss zu einer Handlung führen. Zahlen um der Zahlen willen sind Müll.
Mini-Spickzettel: Was zu zählen und womit zu messen ist
Frage | Was wir denken | Werkzeug | Metriktyp | Was bedeutet |
|---|---|---|---|---|
Wie viel geben Kunden aus? | Durchschnittliche Rechnung (Mittelwert), Median | Pandas/SQL | Beschreibend | Grundlegende Einnahmenrichtlinie |
Wie „lebendig“ ist die Nachfrage? | Konversion, Kaufhäufigkeit | Gruppen, Kohorten | Beschreibend/diagnostisch | Den Trichter verstehen |
Funktioniert das Banner? | Δ Umwandlung, t-Test/Bootstrap | SciPy/Bootsrap | Inf. Statistik | Die Wahrscheinlichkeit, dass der Effekt kein Zufall ist |
Was beeinflusst die Resonanz? | Korrelationen / Feature-Bedeutung | corr(), einfache Regression | Diagnostik | Welche Faktoren sind wirklich wichtig? |
Wie viel verkaufen wir morgen? | Prognose (linear / Bäume) | scikit-learn | Prognose | Wir optimieren Einkauf/Werbung |
Beispiel 1. Café und durchschnittlicher Kassenbon
Szenario: Der Eigentümer möchte verstehen, warum der Umsatz „springt“.
Daten: Tabelle orders (ID, Datum, Betrag, Zahlungsmethode).
Was wir tun:
Wir berechnen Durchschnittlicher Rechnungsbetrag und Median.
Wir bauen Verteilung der Belege.
Wir schauen Wochentag — Wo sind die Spitzentage?
df['weekday'] = df['date'].dt.day_name()
avg_check = df['amount'].mean()
median_check = df['amount'].median()
by_weekday = df.groupby('weekday')['amount'].mean().sort_values(ascending=False)
Schlussfolgerungen: Wenn der durchschnittliche Scheck >> dem Median entspricht, haben Sie einen langen „Schwanz“ teurer Bestellungen. Spitzen am Freitag? Dann ist es besser, die Aktion am Donnerstagabend zu starten.

Beispiel 2. Konversion von der Ansicht zum Kauf
Szenario: Online-Shop: viele Aufrufe, wenige Einkäufe.
Daten: Ereignisse view_product und purchase mit user_id.
views = events.query('event=="view_product"').user_id.nunique()
carts = events.query('event=="add_to_cart"').user_id.nunique()
buys = events.query('event=="purchase"').user_id.nunique()
conv_view_to_cart = carts / views
conv_cart_to_buy = buys / carts
Fazit: Wenn der Verlust in der Phase "Warenkorb → Kauf" auftritt, überprüfen Sie UX, Formfehler oder Versandkosten.
Beispiel 3. Schneller A/B-Test eines Banners
from statsmodels.stats.proportion import proportions_ztest
count = np.array([buys_B, buys_A])
nobs = np.array([visits_B, visits_A])
stat, p = proportions_ztest(count, nobs)
Fazit: Auch bei einer Differenz von +0,8 Prozentpunkten sollten das Konfidenzintervall und die Traffic-Kosten berücksichtigt werden.
Beispiel 4. Verkaufsprognose „für morgen“
X = pd.get_dummies(df[['day_index','weekday']], drop_first=True)
y = df['sales']
model.fit(X_train, y_train)
pred = model.predict(X_test)
mae = np.mean(np.abs(pred - y_test))
Fazit: Eine Prognose ist notwendig, um die Unsicherheit zu verringern, nicht um „genau zu erraten“.
Beispiel 5. Was beeinflusst die Antwort wirklich?
Szenario: E-Mail-Newsletter. Warum werden manche E-Mails geöffnet und andere nicht?
Idee: Korrelationen und logistische Regressionen überprüfen, um den Einfluss von Merkmalen zu bewerten.
Datenbereinigung ist die halbe Miete
Problem | Wie man es bemerkt | Was tun? |
|---|---|---|
Ausfälle |
| Löschen oder durch Median ersetzen |
Emissionen | Boxplot, z-score | Nach Geschäftsregeln einschränken |
Duplikate |
| Schlüssel löschen |
Verschiedene Datumsformate | Fehler beim Parsen |
|
Unvollständige Kategorien | Anteil < 1% | In „Andere“ zusammenfassen |
In Kodike Wir bieten kurze Module zu Python und Analytik mit realen Aufgaben – CSV-Upload, Reinigung, Trichter, Mini-A/B-Test und erstes Modell. Ohne Wasser und mit klaren Ergebnissen.
Und wir haben auch einen aktiven Telegram-Kanal, wo wir coole Ideen diskutieren, Erfahrungen teilen und Aufgaben gemeinsam analysieren — Lernen wird nicht nur nützlich, sondern auch unterhaltsam.
