ChatGPT, Claude, Gemini, Llama — todos son LLMs. ¿Qué los hace funcionar? ¿Por qué a veces "alucinan"? ¿Cómo saben tantas cosas? Esta guía desmitifica los modelos de lenguaje sin necesidad de un doctorado en matemáticas.
¿Qué es un LLM?
Un Large Language Model (LLM) es una red neuronal entrenada con enormes cantidades de texto para predecir qué palabra viene a continuación. Eso es literalmente todo lo que hace — predecir el siguiente token (fragmento de texto) dada la secuencia anterior. Y sin embargo, de esa tarea simple emergen capacidades sorprendentes.
La arquitectura Transformer
Los LLMs modernos se basan en la arquitectura Transformer (Google, 2017, paper "Attention is All You Need"). El componente clave es el mecanismo de atención — permite al modelo "prestar atención" a palabras relevantes de la secuencia completa al predecir cada token, sin importar qué tan lejos estén entre sí.
¿Cómo se entrena un LLM?
El entrenamiento ocurre en tres etapas:
- Pre-training: Se procesa una fracción masiva de internet (Common Crawl, Wikipedia, libros, código). El modelo aprende estadísticas del lenguaje — qué palabras co-ocurren, sintaxis, hechos del mundo — al predecir el siguiente token millones de millones de veces. GPT-3 usó 45 TB de texto, 175 mil millones de parámetros y meses de cómputo en miles de GPUs.
- Fine-tuning supervisado (SFT): Humanos crean ejemplos de conversaciones de alta calidad. El modelo aprende a ser un asistente útil y a seguir instrucciones.
- RLHF (Reinforcement Learning from Human Feedback): Humanos comparan respuestas del modelo. Un modelo de recompensa aprende qué respuestas son mejores. El LLM se optimiza para generar respuestas que el modelo de recompensa califique bien.
¿Por qué alucinan?
Los LLMs no tienen una base de datos de "hechos verdaderos" — solo patrones estadísticos en el texto de entrenamiento. Cuando no tienen suficiente señal para responder correctamente, generan texto que suena plausible pero puede ser falso. A esto se le llama "alucinación".
| Modelo | Empresa | Parámetros (aprox.) | Open source |
|---|---|---|---|
| GPT-4o | OpenAI | ~200B (no confirmado) | No |
| Claude Opus 4 | Anthropic | No revelado | No |
| Gemini 2.0 Pro | No revelado | No | |
| Llama 3.3 | Meta | 70B | Sí (weights) |
Correr un LLM localmente con Ollama
# Instalar Ollama (ollama.ai)
curl -fsSL https://ollama.ai/install.sh | sh
# Descargar y correr Llama 3.2 (3B parámetros, ~2 GB)
ollama run llama3.2
# Otros modelos disponibles:
ollama pull mistral # 7B parámetros
ollama pull codellama # especializado en código
ollama pull deepseek-coder # excelente para programación
# Listar modelos descargados
ollama list
# API REST local (puerto 11434)
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Explica qué es una VLAN en una sola oración.",
"stream": false
}'
"Un LLM no entiende el lenguaje como tú y yo — pero a escala suficiente, la diferencia empieza a volverse filosófica."