Los modelos de lenguaje (LLM) se han convertido en una parte integral del trabajo de un desarrollador moderno. ChatGPT, Claude, Gemini: todos estos servicios funcionan en la nube y necesitan Internet para usarlos. Pero, ¿qué pasa si quieres tener tu propio modelo que funcione directamente en tu ordenador? Veamos cuándo tiene sentido y qué se necesita para ello.
¿Por qué es necesario un LLM local?
Antes de profundizar en los detalles técnicos, vale la pena comprender qué problemas resuelve el modelo local. En primer lugar, la privacidad. Todas tus consultas permanecen en tu ordenador, no se van a ningún sitio y no son analizadas por servicios de terceros. Esto es crítico si trabajas con datos confidenciales de la empresa o información personal del cliente.
En segundo lugar, la independencia de Internet. Los servicios en la nube pueden no estar disponibles debido a problemas de red, mantenimiento u otras razones. El modelo local siempre funciona mientras tu ordenador esté en funcionamiento. En tercer lugar, es la ausencia de restricciones. Muchos servicios en la nube tienen límites en el número de solicitudes por día o requieren pago por uso activo. Con el modelo local, solo pagas por la electricidad.
Pero también hay un inconveniente. Los modelos locales requieren hardware potente, son más lentos que sus homólogos en la nube y la calidad de sus respuestas suele ser inferior a la de las mejores soluciones comerciales. También tendrás que encargarte de la instalación y configuración.
¿Qué hardware necesitarás?
Aquí es donde empieza lo más interesante. Los modelos de lenguaje vienen en diferentes tamaños, y cuanto más grande es el modelo, más inteligente es, pero también requiere más recursos. El tamaño del modelo se mide en parámetros: 7B (7 mil millones), 13B, 70B y así sucesivamente.
Para trabajar cómodamente con el modelo de parámetros 7B, necesitarás una tarjeta gráfica con al menos 8 GB de memoria de vídeo. Puede ser, por ejemplo, una NVIDIA RTX 3060 o una equivalente de AMD. Si deseas ejecutar un modelo con parámetros 13B, es recomendable tener 16 GB de memoria de vídeo. Los modelos 70B+ ya requieren tarjetas profesionales o múltiples GPU.
Es recomendable tener 16 GB de RAM, o mejor 32 GB, especialmente si planeas trabajar con contextos grandes. El procesador no es tan crítico, cualquier chip multinúcleo moderno funcionará. También necesitarás espacio en disco: los modelos en sí pesan desde 4 GB hasta varias decenas de gigabytes, según el tamaño y el formato.
Si no tienes una tarjeta gráfica potente, puedes ejecutar el modelo en el procesador, pero funcionará mucho más lento. En lugar de unos pocos segundos, la respuesta puede tardar un minuto o más.
Herramientas populares para ejecutar LLM
La forma más fácil de empezar a experimentar con modelos locales es utilizar soluciones ya preparadas con una interfaz gráfica. Ollama es una gran opción para principiantes. Es una herramienta de consola que permite descargar y ejecutar modelos con solo dos comandos. Instalamos Ollama, ejecutamos el comando ollama run llama3, y en un minuto ya tenemos un modelo en funcionamiento con el que podemos comunicarnos directamente en el terminal.
Para aquellos que quieren una interfaz web bonita, está LM Studio. Se trata de una aplicación de escritorio con una cómoda interfaz gráfica de usuario, donde puedes seleccionar un modelo del catálogo, descargarlo en un par de clics y empezar a utilizarlo de inmediato. La interfaz es similar a la de ChatGPT, por lo que no será difícil de entender.
Si ya has trabajado con Python, puede que te interese la biblioteca llama.cpp. Se trata de una herramienta más avanzada que ofrece un mayor control sobre los parámetros del modelo y su comportamiento. Muchas otras soluciones, incluida Ollama, funcionan sobre su base.
¿Qué modelos vale la pena probar?
En 2025, hay muchos modelos abiertos que se pueden ejecutar localmente. La familia Llama de Meta sigue siendo una de las más populares. Llama 3 en las versiones 8B y 70B muestra excelentes resultados en la mayoría de las tareas. El modelo funciona bien con la generación de código, las respuestas a preguntas y las tareas creativas.
Otra opción interesante es Mistral. Los modelos de esta línea son más compactos que los Llama de calidad similar, lo que permite ejecutarlos en hardware más modesto. Mistral 7B puede funcionar incluso en portátiles para juegos de gama media.
Para tareas especializadas, como trabajar con código, vale la pena prestar atención a CodeLlama o DeepSeek Coder. Estos modelos están especialmente entrenados en código de programación y son mejores para escribir y analizar programas.

Ejemplo práctico de lanzamiento
Veamos cómo ejecutar un modelo local en la práctica con Ollama. Primero hay que instalar el programa en sí. Para Linux y macOS, basta con ejecutar el comando desde el sitio web oficial, para Windows hay un instalador. Después de la instalación, abra el terminal y ejecute el comando ollama run llama3. Ollama descargará automáticamente el modelo si aún no está en tu ordenador y lanzará un chat interactivo.
Ahora puedes hacer preguntas directamente en la terminal. Intenta escribir «Escribe una función en Python para ordenar una matriz» y mira el resultado. El modelo generará el código e incluso explicará cómo funciona.
Si quieres usar el modelo en tus scripts de Python, Ollama proporciona una API sencilla. Aquí tienes un ejemplo mínimo:
import requests
import json
def ask_llm(prompt):
response = requests.post('http://localhost:11434/api/generate',
json={
'model': 'llama3',
'prompt': prompt
},
stream=True)
for line in response.iter_lines():
if line:
data = json.loads(line)
if 'response' in data:
print(data['response'], end='')
ask_llm("Explain what recursion is")Este código envía una solicitud a un modelo ejecutado localmente y muestra la respuesta a medida que se genera.
Optimización y ajuste fino
Cuando te familiarices con el uso básico, puedes empezar a experimentar con los parámetros. Uno de los parámetros clave es la temperatura (temperature). Controla la «creatividad» del modelo. Un valor de 0,1 dará respuestas más predecibles y conservadoras, mientras que 0,9 dará respuestas más diversas y creativas, pero a veces menos precisas.
El parámetro top_p funciona de manera similar, pero utiliza un mecanismo diferente. Si temperature controla la aleatoriedad de la selección de tokens, entonces top_p limita el conjunto de tokens de los que se selecciona la siguiente palabra.
También puedes configurar el contexto: la cantidad de tokens que el modelo «recuerda» de la conversación anterior. Cuanto más contexto, más memoria se requiere, pero el modelo entiende mejor los diálogos largos.
Integración en el flujo de trabajo
El LLM local se puede integrar en casi cualquier herramienta de desarrollo. Muchos editores de código modernos, como VS Code, admiten complementos para trabajar con modelos locales. Por ejemplo, la extensión Continue permite usar Ollama para autocompletar código y responder preguntas directamente en el editor.
Puedes crear tu propio bot de Telegram que se comunicará a través de tu modelo local. O escribir un script para generar automáticamente la documentación del código. Las posibilidades están limitadas solo por tu imaginación y la potencia de tu ordenador.
¿Vale la pena?
No hay una respuesta inequívoca: todo depende de tus tareas y capacidades. Si ya tienes un ordenador potente con una buena tarjeta gráfica, merece la pena intentarlo. Obtendrás experiencia con la infraestructura de ML, comprenderás cómo funcionan los modelos de lenguaje desde dentro y obtendrás una herramienta que funciona sin conexión a Internet.
Si el objetivo principal es simplemente utilizar la IA en el trabajo y no hay hardware, los servicios en la nube serán más convenientes y eficientes. Dan una mejor calidad de respuestas, funcionan más rápido y no requieren conocimientos técnicos para configurarlos.
Pero incluso si no planeas usar modelos locales constantemente, vale la pena intentarlo al menos para ampliar tus horizontes. Instala Ollama, ejecuta un pequeño modelo y experimenta. Tal vez encuentres un uso para ella en tus proyectos, o tal vez simplemente obtengas nuevos conocimientos sobre cómo funcionan las tecnologías modernas de IA.
¿Quieres profundizar tus conocimientos de Python y aprender a trabajar con diferentes tecnologías?
Te invitamos a la plataforma Kodik, donde creamos cursos y materiales especialmente para desarrolladores principiantes. Y también tenemos un genial Canal de Telegram con una comunidad amistosa donde puedes hacer preguntas, compartir experiencias y encontrar personas afines. ¡Únete!
