Sprachmodelle (LLM) sind zu einem festen Bestandteil der Arbeit eines modernen Entwicklers geworden. ChatGPT, Claude, Gemini — all diese Dienste laufen in der Cloud und benötigen eine Internetverbindung, um sie nutzen zu können. Aber was ist, wenn Sie Ihr eigenes Modell haben möchten, das direkt auf Ihrem Computer läuft? Lassen Sie uns herausfinden, wann dies sinnvoll ist und was dafür erforderlich ist.
Warum braucht man überhaupt ein lokales LLM?
Bevor Sie sich mit den technischen Details befassen, sollten Sie verstehen, welche Probleme das lokale Modell löst. Erstens ist es die Privatsphäre. Alle Ihre Anfragen bleiben auf Ihrem Computer, gehen nirgendwo hin und werden nicht von Drittanbietern analysiert. Dies ist von entscheidender Bedeutung, wenn Sie mit vertraulichen Unternehmensdaten oder persönlichen Kundendaten arbeiten.
Zweitens, Unabhängigkeit vom Internet. Cloud-Dienste sind möglicherweise aufgrund von Netzwerkproblemen, Wartungsarbeiten oder aus anderen Gründen nicht verfügbar. Das lokale Modell funktioniert immer, solange Ihr Computer läuft. Drittens gibt es keine Einschränkungen. Viele Cloud-Dienste haben Beschränkungen für die Anzahl der Anfragen pro Tag oder erfordern eine Zahlung für die aktive Nutzung. Beim lokalen Modell zahlen Sie nur für den Strom.
Aber es gibt auch eine Kehrseite. Lokale Modelle erfordern leistungsstarke Hardware, sind langsamer als Cloud-Analoga und die Qualität ihrer Antworten ist häufig schlechter als bei kommerziellen Top-Lösungen. Außerdem müssen Sie sich selbst um die Installation und Konfiguration kümmern.
Welches Eisen wird benötigt?
Hier beginnt der interessanteste Teil. Sprachmodelle gibt es in verschiedenen Größen, und je größer das Modell, desto intelligenter ist es, aber desto mehr Ressourcen benötigt es auch. Die Größe des Modells wird in Parametern gemessen: 7B (7 Milliarden), 13B, 70B und so weiter.
Für komfortables Arbeiten mit dem Modell mit 7B-Parametern benötigen Sie eine Grafikkarte mit mindestens 8 GB Videospeicher. Dies kann beispielsweise eine NVIDIA RTX 3060 oder ein entsprechendes Modell von AMD sein. Wenn Sie ein Modell mit 13B-Parametern ausführen möchten, ist es ratsam, 16 GB Videospeicher zu haben. 70B+ Modelle erfordern bereits professionelle Karten oder mehrere GPUs.
Es ist wünschenswert, 16 GB RAM zu haben, und noch besser 32 GB, besonders wenn Sie mit großen Kontexten arbeiten möchten. Der Prozessor ist nicht so kritisch, jeder moderne Multi-Core-Chip ist geeignet. Sie benötigen auch Speicherplatz: Die Modelle selbst wiegen je nach Größe und Format zwischen 4 GB und mehreren Dutzend Gigabyte.
Wenn Sie keine leistungsstarke Grafikkarte haben, können Sie das Modell auf dem Prozessor ausführen, aber es wird viel langsamer arbeiten. Anstatt ein paar Sekunden kann es eine Minute oder länger dauern, bis eine Antwort erfolgt.
Beliebte Tools zum Ausführen von LLMs
Der einfachste Weg, um mit lokalen Modellen zu experimentieren, ist die Verwendung vorgefertigter Lösungen mit einer grafischen Benutzeroberfläche. Ollama ist eine gute Wahl für Anfänger. Es ist ein Konsolentool, mit dem Sie Modelle mit nur zwei Befehlen herunterladen und ausführen können. Installieren Sie Ollama, führen Sie den Befehl ollama run llama3 aus, und innerhalb einer Minute haben Sie ein Modell, mit dem Sie direkt im Terminal kommunizieren können.
Für diejenigen, die eine schöne Weboberfläche wünschen, gibt es LM Studio. Es ist eine Desktop-Anwendung mit einer benutzerfreundlichen GUI, bei der Sie ein Modell aus dem Katalog auswählen, es mit ein paar Klicks herunterladen und sofort verwenden können. Die Benutzeroberfläche ähnelt ChatGPT, sodass es nicht schwer zu verstehen ist.
Wenn Sie bereits mit Python gearbeitet haben, könnte die Bibliothek llama.cpp für Sie interessant sein. Es ist ein fortschrittlicheres Tool, das mehr Kontrolle über die Parameter und das Verhalten des Modells gibt. Viele andere Lösungen, darunter Ollama, basieren darauf.
Welche Modelle solltest du ausprobieren?
Im Jahr 2025 gibt es viele offene Modelle, die lokal ausgeführt werden können. Die Llama-Familie von Meta bleibt eine der beliebtesten. Llama 3 in den Versionen 8B und 70B zeigt bei den meisten Aufgaben hervorragende Ergebnisse. Das Modell eignet sich gut für die Codegenerierung, die Beantwortung von Fragen und kreative Aufgaben.
Eine weitere interessante Option ist Mistral. Die Modelle dieser Linie sind kompakter als Llama von ähnlicher Qualität, wodurch sie auf bescheidenerer Hardware ausgeführt werden können. Mistral 7B kann sogar auf Gaming-Laptops der Mittelklasse laufen.
Für spezielle Aufgaben, wie z. B. die Arbeit mit Code, sollten Sie CodeLlama oder DeepSeek Coder in Betracht ziehen. Diese Modelle wurden speziell für Programmiercode trainiert und sind besser in der Lage, Programme zu schreiben und zu analysieren.

Praktisches Beispiel für den Start
Sehen wir uns an, wie man mit Ollama ein lokales Modell in die Praxis umsetzt. Zuerst müssen Sie das Programm selbst installieren. Für Linux und macOS reicht es aus, den Befehl von der offiziellen Website auszuführen, für Windows gibt es ein Installationsprogramm. Öffnen Sie nach der Installation ein Terminal und führen Sie den Befehl ollama run llama3 aus. Ollama lädt das Modell automatisch herunter, wenn es sich noch nicht auf Ihrem Computer befindet, und startet einen interaktiven Chat.
Jetzt können Sie Fragen direkt im Terminal stellen. Versuchen Sie, "Schreibe eine Python-Funktion zum Sortieren eines Arrays" zu schreiben und sehen Sie sich das Ergebnis an. Das Modell generiert den Code und erklärt sogar, wie er funktioniert.
Wenn Sie das Modell in Ihren Python-Skripten verwenden möchten, bietet Ollama eine einfache API. Hier ist ein minimales Beispiel:
import requests
import json
def ask_llm(prompt):
response = requests.post('http://localhost:11434/api/generate',
json={
'model': 'llama3',
'prompt': prompt
},
stream=True)
for line in response.iter_lines():
if line:
data = json.loads(line)
if 'response' in data:
print(data['response'], end='')
ask_llm("Explain what recursion is")Dieser Code sendet eine Anfrage an das lokal ausgeführte Modell und gibt die Antwort aus, während sie generiert wird.
Optimierung und Feinabstimmung
Sobald Sie sich mit der grundlegenden Verwendung vertraut gemacht haben, können Sie mit den Parametern experimentieren. Einer der Schlüsselparameter ist die Temperatur (temperature). Er steuert die "Kreativität" des Modells. Ein Wert von 0,1 führt zu vorhersehbareren und konservativeren Antworten, während ein Wert von 0,9 vielfältigere und kreativere, aber manchmal weniger genaue Antworten liefert.
Der Parameter top_p funktioniert ähnlich, verwendet jedoch einen anderen Mechanismus. Wenn temperature die Zufälligkeit der Tokenauswahl steuert, dann schränkt top_p die Menge der Token ein, aus denen das nächste Wort ausgewählt wird.
Sie können auch den Kontext anpassen - die Anzahl der Token, die sich das Modell aus dem vorherigen Gespräch „merkt“. Je mehr Kontext, desto mehr Speicher wird benötigt, aber das Modell versteht lange Dialoge besser.
Integration in den Arbeitsablauf
Ein lokales LLM kann in fast jedes Entwicklungstool integriert werden. Viele moderne Code-Editoren wie VS Code unterstützen Plugins für die Arbeit mit lokalen Modellen. Mit der Erweiterung Continue können Sie beispielsweise Ollama verwenden, um Code automatisch zu vervollständigen und Fragen direkt im Editor zu beantworten.
Sie können Ihren eigenen Telegram-Bot erstellen, der über Ihr lokales Modell kommuniziert. Oder Sie schreiben ein Skript, um automatisch Dokumentation für den Code zu generieren. Die Möglichkeiten sind nur durch Ihre Vorstellungskraft und die Leistung Ihres Computers begrenzt.
Ist es das wert?
Es gibt keine eindeutige Antwort — alles hängt von Ihren Aufgaben und Möglichkeiten ab. Wenn Sie bereits einen leistungsstarken Computer mit einer guten Grafikkarte haben, lohnt es sich, es auszuprobieren. Sie sammeln Erfahrung mit der ML-Infrastruktur, verstehen, wie Sprachmodelle von innen funktionieren, und erhalten ein Tool, das ohne Internetverbindung funktioniert.
Wenn das Hauptziel darin besteht, KI einfach in der Arbeit zu nutzen und keine Hardware vorhanden ist, sind Cloud-Dienste bequemer und effizienter. Sie liefern qualitativ bessere Antworten, arbeiten schneller und erfordern keine technischen Kenntnisse für die Einrichtung.
Aber auch wenn Sie nicht vorhaben, ständig lokale Modelle zu verwenden, lohnt es sich, es zumindest zu versuchen, um Ihren Horizont zu erweitern. Installieren Sie Ollama, starten Sie ein kleines Modell und experimentieren Sie. Vielleicht finden Sie eine Anwendung dafür in Ihren Projekten, oder vielleicht erhalten Sie einfach nur neue Erkenntnisse darüber, wie moderne KI-Technologien funktionieren.
Möchten Sie Ihr Wissen in Python vertiefen und lernen, mit verschiedenen Technologien zu arbeiten?
Wir laden Sie auf die Plattform ein Kodik, wo wir Kurse und Materialien speziell für angehende Entwickler erstellen. Und wir haben auch einen coolen Telegram-Kanal mit einer freundlichen Community, in der Sie Fragen stellen, Erfahrungen teilen und Gleichgesinnte finden können. Machen Sie mit!
