Guía · Fundamentos

¿WTF es un LLM?

El cerebro de todos los agentes, sin una sola ecuación.

Los modelos de lenguaje grandes son los motores de ChatGPT, Claude, Gemini y todos los agentes de IA de la economía de los agentes. Esto es lo que son de verdad, explicado de forma sencilla y sin una sola ecuación.

En una frase

Un modelo de lenguaje grande (LLM) es un tipo de IA que se ha entrenado con cantidades enormes de texto y ha aprendido a predecir, con una precisión asombrosa, qué palabras deberían venir a continuación.

Dicho así parece sencillo. Sus consecuencias no lo son. De esa única capacidad, predecir la siguiente palabra, surge la capacidad de escribir, razonar, resumir, traducir, programar, explicar, debatir y planificar. Es uno de los avances más sorprendentes y trascendentales de la historia de la informática.

¿Cómo puede salir inteligencia de predecir palabras?

Esta es la pregunta que desconcierta a casi todo el mundo. «Predecir la siguiente palabra» suena al autocompletado del móvil. No lo es. Te explicamos por qué.

Para predecir bien qué palabra viene después en una frase, tienes que entender la frase. Para entender la frase, tienes que entender el párrafo. Para entender el párrafo, tienes que entender el tema, el contexto, los matices.

Cuando los investigadores entrenaron modelos con billones de palabras escritas por personas (libros, artículos, webs, código, artículos científicos, conversaciones), los modelos no aprendieron solo a encadenar palabras. Aprendieron a representar significado. Construyeron modelos internos de cómo se relacionan los conceptos entre sí.

El resultado no fue un autocompletado con ínfulas. Fue un sistema capaz de razonar sobre problemas que nunca había visto, de escribir en estilos que nadie le había enseñado expresamente y de explicar conceptos en decenas de idiomas y campos.

¿De dónde salieron los LLM?

La historia de los LLM es sorprendentemente reciente y va muy deprisa:

AñoQué pasó
2017Investigadores de Google publican «Attention Is All You Need», el artículo que presenta la arquitectura Transformer, la base técnica de todos los LLM modernos.
2018Google lanza BERT. OpenAI lanza GPT-1. Empieza la carrera.
2020OpenAI lanza GPT-3: 175.000 millones de parámetros y una capacidad que deja a todos de piedra. Los desarrolladores empiezan a construir sobre él a través de la API.
2022OpenAI lanza ChatGPT (GPT-3.5). 100 millones de usuarios en 2 meses. Se funda Anthropic, que lanza Claude.
2023Sale GPT-4. Aparecen los modelos open source (Llama, Mistral). AutoGPT se hace viral como primer intento de agente autónomo.
2024Los modelos ya son lo bastante capaces para un uso agéntico fiable. Anthropic publica MCP. Empieza la economía de los agentes.
2025Se lanza Claude Code. Los modelos chinos de pesos abiertos (DeepSeek, Qwen, Kimi) igualan a los punteros por una fracción del coste. Las tareas autónomas de varias horas se vuelven fiables.
2026Todos los grandes laboratorios lanzan un agente de trabajo. Anthropic divide su modelo principal en un nivel público (Fable) y otro restringido (Mythos). GPT-6, Gemini 3.8, Meta Muse, DeepSeek V4.

Los principales LLM de 2026: quién hace qué

Los nombres de los modelos y sus números de versión cambian cada pocos meses. Los laboratorios que hay detrás, y aquello por lo que se conoce a cada uno, cambian mucho más despacio. Fíjate en los laboratorios, no en los números.

Claude (Anthropic)

La familia de modelos detrás de Claude Code, Cowork y Copilot Cowork de Microsoft, y la opción por defecto en OpenClaw. Niveles: Fable (el buque insignia, un nivel nuevo por encima de Opus presentado en 2026), Opus, Sonnet y Haiku. El entrenamiento con Constitutional AI de Anthropic hace de Claude el modelo al que recurren casi todos los que construyen agentes cuando importan la fiabilidad y la honestidad en sesiones largas sin supervisión. Ventana de contexto: un millón de tokens. Consulta la guía ¿WTF es Claude?

GPT (OpenAI)

Los modelos detrás de ChatGPT, que sigue siendo el producto de IA de consumo más usado del mundo, y de los agentes de OpenAI: ChatGPT Work, Codex y la Agents API. GPT-6 llegó en septiembre de 2026, después de la familia GPT-5.6 en julio. El punto fuerte de OpenAI es el alcance: cientos de millones de personas ya tienen la app.

Gemini (Google DeepMind)

La familia principal de Google, ahora en Gemini 3.8, y el modelo detrás de Gemini Agent, Auto Browse de Chrome y Jules, el agente de programación de Google. Muy integrada con el Buscador, Workspace y Android. Google también creó el protocolo Agent2Agent (A2A) para que agentes de empresas distintas hablen entre sí.

Muse (Meta)

El reinicio de Meta en 2026: una nueva familia de modelos y un agente personal de consumo, ambos llamados Muse, que llegan a través de WhatsApp y de una app propia con plan gratuito. La apuesta de Meta es la distribución: tres mil millones de personas ya usan sus apps de mensajería.

Grok (xAI)

Los modelos de Elon Musk, que ahora forman parte de SpaceX después de que esta comprara xAI y la herramienta de programación Cursor. El modelo detrás de Grok Bot, un equipo de agentes que comparten un ordenador en la nube.

Los modelos chinos de pesos abiertos

DeepSeek, Qwen de Alibaba, Kimi de Moonshot, GLM de Zhipu y MiniMax. Se publican con pesos abiertos (cualquiera puede descargarlos y ejecutarlos) por una fracción del precio de los modelos punteros estadounidenses, y tan cerca en capacidad que muchísimos agentes independientes funcionan con ellos. El avance de DeepSeek a principios de 2025, un modelo barato de entrenar, fue el momento en que esto se convirtió en una carrera entre dos continentes. Guía: ¿WTF está pasando con la IA china?

Otros modelos abiertos

La familia Llama de Meta, que fue el modelo abierto por defecto, ha quedado sustituida dentro de Meta por Muse. Mistral (Francia) hace modelos más pequeños y eficientes. OpenClaw, Paperclip y casi todos los frameworks de agentes te permiten conectar cualquiera de ellos con una clave de API.

En qué son buenos los LLM y en qué no

Los LLM son buenos enLos LLM son malos en
Escribir con cualquier estilo o tonoCálculos exactos (dan aproximaciones)
Resumir documentos largosInformación al día (sus datos tienen fecha de corte)
Escribir y explicar códigoGarantizar que los datos son correctos (pueden «alucinar»)
Traducir entre idiomasSaber lo que no saben
Razonar problemas de varios pasosResponder igual ante la misma entrada
Generar ideas creativasTareas que exigen memoria persistente por defecto
Explicar temas complejos de forma sencillaInteractuar con el mundo físico (sin herramientas de agente)

Las alucinaciones: la limitación más importante

Lo más importante que hay que entender de los LLM son las alucinaciones: la tendencia a producir textos seguros de sí mismos y verosímiles que son falsos.

Ocurre porque los LLM no «saben» datos como los sabe una base de datos. Generan texto a partir de patrones aprendidos durante el entrenamiento. Cuando les preguntas por algo que queda fuera de sus datos de entrenamiento, o en el límite de lo que saben, a veces generan un texto que suena bien pero no lo es.

Un abogado llegó a presentar ante un tribunal de Estados Unidos un escrito que citaba casos generados por ChatGPT. Los casos no existían. Al juez no le hizo ninguna gracia.

Por eso sigue siendo importante que las personas supervisen a los agentes de IA, sobre todo en decisiones con mucho en juego. Los modelos son cada vez mejores sabiendo lo que no saben, pero no son perfectos. Trata lo que produce un LLM como un primer borrador muy competente, no como la fuente definitiva de la verdad.

Parámetros, tokens y ventanas de contexto

Hay tres términos técnicos que salen constantemente cuando se habla de LLM. Esto es lo que significan de verdad:

Parámetros

Los parámetros son los valores numéricos del interior del modelo que se fueron ajustando durante el entrenamiento. GPT-3 tenía 175.000 millones de parámetros. Los modelos punteros actuales tienen billones. Más parámetros suele significar más capacidad, pero también más coste de funcionamiento. Dicho de forma sencilla: los parámetros vienen a ser el «tamaño» del cerebro del modelo.

Tokens

Los LLM no procesan palabras: procesan tokens. Un token son unos 3 o 4 caracteres, o unas 0,75 palabras. «Hello, how are you?» («Hola, ¿qué tal estás?») son unos 6 tokens. El uso de una API de IA se paga en tokens: tanto los que envías (entrada) como los que genera el modelo (salida). Una página de texto normal ronda los 500 tokens.

Ventana de contexto

La ventana de contexto es cuánto texto puede «ver» un LLM a la vez: el historial de la conversación, el documento que le has pasado, las instrucciones que le has dado. Los primeros modelos tenían ventanas de contexto minúsculas (4.000 tokens, unas 3 páginas de texto). Los modelos actuales de Claude tienen una ventana de contexto de 1 millón de tokens: unas 750.000 palabras, el equivalente a varias novelas enteras. Por eso los agentes actuales pueden trabajar a la vez con bases de código completas o documentos largos.

Constitutional AI: el enfoque de Anthropic para la seguridad

Cada empresa entrena sus LLM de una manera. Merece la pena entender el enfoque de Anthropic, Constitutional AI, porque influye directamente en cómo se comporta Claude como agente.

Constitutional AI es una técnica de entrenamiento en la que el modelo recibe un conjunto de principios (una «constitución») y se le entrena para criticar y revisar lo que produce según esos principios. El resultado es un modelo que es útil, honesto e inofensivo de forma más fiable, no porque esté restringido, sino porque ha interiorizado unos valores.

Esto importa en el uso agéntico porque un agente que funciona solo durante horas tiene que tomar decisiones de criterio constantemente. Un modelo entrenado con Constitutional AI tiene más probabilidades de resolver con sensatez los casos límite: negarse a hacer cosas que podrían causar daño, señalar las situaciones ambiguas para que las revise una persona y ser honesto sobre sus limitaciones.

Los LLM y la economía de los agentes

El LLM es el cerebro de todo agente de IA. Sin él, un agente no es más que un conjunto de reglas «si pasa esto, haz aquello»: útil, pero frágil. Con él, el agente puede:

  • Entender instrucciones ambiguas y averiguar qué querías decir en realidad.
  • Resolver situaciones para las que no se le programó expresamente.
  • Elaborar planes para conseguir objetivos, no solo ejecutar guiones fijos.
  • Leer y entender datos no estructurados: correos, documentos, páginas web.
  • Comunicar sus resultados en lenguaje natural.

La rápida mejora de los LLM en los últimos tres años, de GPT-3 en 2020 a Fable, GPT-6 y Gemini 3.8 en 2026, es el motivo principal de que la economía de los agentes esté pasando ahora y no dentro de diez años. Los modelos cruzaron un umbral de capacidad que hizo posible una acción autónoma y fiable.

Glosario

LLM (Large Language Model)
: un modelo de lenguaje grande, una IA entrenada con enormes cantidades de texto para predecir y generar lenguaje. El cerebro de ChatGPT, Claude, Gemini, Muse y Grok.
Transformer
: la arquitectura de red neuronal en la que se basan todos los LLM modernos. La presentó Google en 2017.
Parámetros
: los valores numéricos de un LLM que se ajustan durante el entrenamiento. Más parámetros = en general, más capacidad.
Token
: la unidad con la que los LLM procesan el texto. Unos 3 o 4 caracteres o 0,75 palabras. El uso de una API se paga en tokens.
Ventana de contexto
: cuánto texto puede procesar un LLM a la vez. Modelos punteros actuales: hasta 1 millón de tokens.
Alucinación
: cuando un LLM genera, con total seguridad, un texto con datos falsos. Una limitación clave que hay que entender.
Constitutional AI
: la técnica de Anthropic para entrenar modelos útiles, honestos e inofensivos a partir de un conjunto de principios.
SWE-bench
: el benchmark de referencia para medir el rendimiento de los LLM en tareas reales de ingeniería de software.
Fine-tuning
: seguir entrenando un LLM ya existente con un conjunto de datos concreto para que rinda mejor en una tarea concreta.
Inferencia
: ejecutar un LLM para que genere una respuesta. La parte de «pensar», frente al entrenamiento.
Modelo de pesos abiertos
: un LLM cuyos pesos son públicos: cualquiera puede descargarlo y ejecutarlo. Ejemplos: DeepSeek, Qwen, Kimi, Mistral, Llama.

Ya sabes qué son los LLM. Aquí tienes el resto de la serie WTF Agents.

Consigue el resto de la serie

Todas las guías WTF Agents se escriben igual: lenguaje claro, sin humo y sin jerga. 7 € cada una, o llévate un pack.

Para seguir

5 guías
Consigue la guía en PDF · 7 €