Tecnología que te entiende
LLMs explicados: cómo funcionan GPT, Claude y Llama
IA

LLMs explicados: cómo funcionan GPT, Claude y Llama

10 Jun 2026 3 min de lectura 902 vistas

ChatGPT, Claude, Gemini, Llama — todos son LLMs. ¿Qué los hace funcionar? ¿Por qué a veces "alucinan"? ¿Cómo saben tantas cosas? Esta guía desmitifica los modelos de lenguaje sin necesidad de un doctorado en matemáticas.

¿Qué es un LLM?

Un Large Language Model (LLM) es una red neuronal entrenada con enormes cantidades de texto para predecir qué palabra viene a continuación. Eso es literalmente todo lo que hace — predecir el siguiente token (fragmento de texto) dada la secuencia anterior. Y sin embargo, de esa tarea simple emergen capacidades sorprendentes.

La arquitectura Transformer

Los LLMs modernos se basan en la arquitectura Transformer (Google, 2017, paper "Attention is All You Need"). El componente clave es el mecanismo de atención — permite al modelo "prestar atención" a palabras relevantes de la secuencia completa al predecir cada token, sin importar qué tan lejos estén entre sí.

💡 Tokens, no palabras: Los LLMs no procesan palabras enteras sino "tokens" — fragmentos de texto. En inglés, un token ≈ 0.75 palabras. "Unbelievable" es un token, "impresionante" son 3 tokens (im-presion-ante). GPT-4 tiene un contexto de 128,000 tokens ≈ 96,000 palabras ≈ un libro corto.

¿Cómo se entrena un LLM?

El entrenamiento ocurre en tres etapas:

  1. Pre-training: Se procesa una fracción masiva de internet (Common Crawl, Wikipedia, libros, código). El modelo aprende estadísticas del lenguaje — qué palabras co-ocurren, sintaxis, hechos del mundo — al predecir el siguiente token millones de millones de veces. GPT-3 usó 45 TB de texto, 175 mil millones de parámetros y meses de cómputo en miles de GPUs.
  2. Fine-tuning supervisado (SFT): Humanos crean ejemplos de conversaciones de alta calidad. El modelo aprende a ser un asistente útil y a seguir instrucciones.
  3. RLHF (Reinforcement Learning from Human Feedback): Humanos comparan respuestas del modelo. Un modelo de recompensa aprende qué respuestas son mejores. El LLM se optimiza para generar respuestas que el modelo de recompensa califique bien.

¿Por qué alucinan?

Los LLMs no tienen una base de datos de "hechos verdaderos" — solo patrones estadísticos en el texto de entrenamiento. Cuando no tienen suficiente señal para responder correctamente, generan texto que suena plausible pero puede ser falso. A esto se le llama "alucinación".

Modelo Empresa Parámetros (aprox.) Open source
GPT-4o OpenAI ~200B (no confirmado) No
Claude Opus 4 Anthropic No revelado No
Gemini 2.0 Pro Google No revelado No
Llama 3.3 Meta 70B Sí (weights)

Correr un LLM localmente con Ollama

# Instalar Ollama (ollama.ai)
curl -fsSL https://ollama.ai/install.sh | sh

# Descargar y correr Llama 3.2 (3B parámetros, ~2 GB)
ollama run llama3.2

# Otros modelos disponibles:
ollama pull mistral          # 7B parámetros
ollama pull codellama        # especializado en código
ollama pull deepseek-coder   # excelente para programación

# Listar modelos descargados
ollama list

# API REST local (puerto 11434)
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Explica qué es una VLAN en una sola oración.",
  "stream": false
}'
✅ LLMs locales vs API: Los modelos locales (Llama, Mistral) son gratuitos, privados y sin latencia de red — pero requieren GPU o RAM suficiente. Los modelos de API (GPT-4, Claude) son más capaces pero tienen costo. Para tareas simples y privacidad, Ollama + Llama 3 es excelente.
"Un LLM no entiende el lenguaje como tú y yo — pero a escala suficiente, la diferencia empieza a volverse filosófica."