Guía · El mapa

¿Qué IA debería usar de verdad?

Seis familias de modelos, una clasificación. Esta es la que de verdad te conviene.

Claude, ChatGPT, Gemini, Muse, Grok, DeepSeek. Seis familias, una versión nueva cada mes y una clasificación que cambia cada semana. Así se elige sin leer ni un solo benchmark, y esto es lo que cada una hace mal sin que nadie lo diga.

En una frase

No hay una IA mejor. Hay una IA mejor para lo que estás haciendo hoy, y las diferencias entre los mejores modelos ya son menores que las diferencias en cómo los usas.

Es la respuesta honesta, y también la útil. Esta guía te da la decisión en una tabla, los planes y los precios, lo que miden de verdad las clasificaciones y las pegas que nadie pone en la página de precios.

En cifras — septiembre de 2026

Todo esto es una foto fija. Las familias de abajo son estables; las cifras, no.

6familias de modelos que importan a una persona normal: Claude, GPT, Gemini, Muse, Grok, DeepSeek
Fable 5.1en lo más alto del índice independiente Artificial Analysis Intelligence Index desde el 1 de septiembre, con Opus 5 muy cerca a mitad de precio
GPT-6 Astralo más nuevo de OpenAI, del 3 de septiembre, tras la familia GPT-5.6 Sol / Terra / Luna de julio
20 $el plan mensual estándar en todos los laboratorios: ChatGPT Plus, Claude Pro, Muse, el plan de IA de Google
100–200 $el nivel para usuarios intensivos: ChatGPT Pro, Claude Max, el plan superior de Muse
0,20 $ frente a 50 $por millón de tokens de salida: el modelo casi puntero más barato (GPT-5.6 Luna) frente al más caro (Fable 5.1). Un rango de 250×
0 $la app de chat de DeepSeek, sin ningún plan de pago

La decisión en una tabla

Empieza aquí. Elige la fila que encaje con lo que estás haciendo.

Quieres...UsaPor qué
Hacer preguntas, tener respuestas rápidas, charlar a diarioChatGPT (gratis o Plus)La mayor base de usuarios y la app de consumo más pulida. Todo el mundo que conoces la usa.
Escribir cualquier cosa más larga que un correoClaudeLa preferida de forma constante por su voz, su estructura y por mantener el estilo en textos largos.
Delegar trabajo de verdad en tus archivos y appsClaude (Cowork) o ChatGPT WorkLos dos agentes de trabajo de un plan de 20 $. Mira la guía de Cowork.
Crear software sin ser desarrolladorClaude CodeLa app de escritorio cambió quién puede usarlo. Mira su guía.
Tener un agente trabajando horas sin supervisiónClaude Fable u OpusLo que importa es el comportamiento (pregunta cuando duda, avisa de sus propios errores), no la puntuación.
Tener un agente que reserve, compre y escriba mensajes por tiMeta Muse (u OpenClaw)Muse es gratis, está en WhatsApp y está hecho justo para esto. OpenClaw si quieres que sea tuyo.
Trabajar dentro de Google: Gmail, Docs, SearchGeminiNada más vive dentro de las herramientas que ya abres.
Trabajar dentro de Microsoft: Outlook, Teams, ExcelCopilot CoworkEl agente de Microsoft 365, que funciona con Claude.
Seguir las noticias en directo y lo que se dice en X ahora mismoGrokBúsqueda nativa en tiempo real en X. Nadie más la tiene.
No pagar nada, o casi nadaDeepSeekChat gratis y una API hasta 100 veces más barata que las rivales de EE. UU. Lee la pega más abajo.
Usar un modelo en tu propio equipoDeepSeek, Qwen, KimiPesos abiertos. Descargas, ejecutas y tus datos se quedan contigo.

Si solo vas a pagar una: Claude Pro o ChatGPT Plus, 20 $, y tienes cubierto el 90 % de lo que puede hacer cualquiera de ellas. Añade la otra cuando encuentres una tarea que la primera haga mal.

Las seis familias: cómo es cada una de verdad

Claude (Anthropic)

El modelo que eligió la mayor parte de la economía de los agentes. El mejor en trabajo largo y cuidadoso (escritura, análisis, código y sesiones de agente que duran horas) porque avisa cuando no está seguro en lugar de adivinar y se da cuenta de sus propios errores. Fable es el buque insignia, Opus la opción puntera para el día a día, Sonnet el caballo de batalla y Haiku el barato. La pega: Fable rechaza un conjunto reducido de peticiones peligrosas de ciberseguridad y biología, y es el modelo más caro del mercado por token. Mira la guía «¿WTF es Claude?».

GPT / ChatGPT (OpenAI)

El que todo el mundo ha usado. ChatGPT es la app de consumo más pulida, con el abanico más amplio de herramientas integradas, y GPT-6 Astra es el modelo puntero más reciente. ChatGPT Work y Codex son los agentes de OpenAI. Lo mejor para respuestas rápidas, lluvias de ideas creativas, imágenes y todo lo que dependa del alcance. La pega: un evaluador independiente señaló en la propia ficha técnica del modelo un comportamiento de «maquinación» elevado en el nivel GPT-5.6 Sol, así que para trabajos en los que necesitas que el modelo no se salga de las reglas que le pones, los niveles más conservadores son la opción más segura.

Gemini (Google)

Más fuerte donde está Google: dentro de Gmail, Docs, Drive, Search y Android, y en todo lo que tenga que ver con imágenes, vídeo o documentos muy largos. Gemini 3.8 Flash es rápido y barato; Google dice que sus precios son de lanzamiento. Gemini Agent y Auto Browse de Chrome son los agentes de Google. La pega: tiende a ser irregular (excelente con un prompt, plano con el siguiente), y los nombres de producto de Google cambian más rápido que los de nadie.

Muse (Meta)

La familia más nueva, y un reinicio de verdad para Meta. Muse Spark tiene un precio competitivo, y el agente Muse (gratis, en WhatsApp y en una app propia) reserva, compra, negocia y rellena formularios por ti. La pega es la que más importa de toda esta guía: el nivel barato «Contributor» de Muse es barato porque Meta entrena con tus prompts. Mira en qué nivel estás antes de pegar nada privado. La propia plantilla de Meta avisó de fallos de seguridad días antes del lanzamiento.

Grok (xAI)

El modelo de Elon Musk, ahora dentro de SpaceX junto a Cursor. Lo que solo tiene Grok es la búsqueda nativa en tiempo real en X, que lo convierte en el mejor modelo para saber «qué está pasando ahora mismo». Este verano encabezó un índice de agentes, y Grok Bot es un agente de trabajo serio. La pega: la personalidad es una virtud o un defecto según tu gusto, y todo ello pertenece ahora a una empresa de cohetes que también es dueña de tu editor de código.

DeepSeek y los modelos abiertos chinos

DeepSeek V4 y su nivel Flash cuestan una mínima parte que los modelos de EE. UU., y la app de chat es gratis, sin ningún plan de pago. Qwen, Kimi y GLM van muy cerca, y todos son de pesos abiertos: puedes descargarlos, ejecutarlos en tu propio ordenador y quedarte con cada byte. Es lo que hay debajo de muchísimos agentes independientes. La pega: las versiones alojadas guardan tus datos en servidores de China bajo la ley china, los modelos están entrenados para esquivar temas políticamente sensibles y la mayoría de las empresas occidentales no pueden usarlos por motivos de cumplimiento normativo. Si los descargas y los ejecutas tú, nada de eso aplica.

Los planes y lo que cuestan

Los planes de consumo se han igualado. Todos los laboratorios tienen un plan gratuito, uno de 20 $ y uno de 100–200 $.

Gratis20 $/mesDesde 100 $/mes
ClaudeSolo chatPro: Cowork, Claude Code, límites más altosMax: 5× o 20× los límites
ChatGPTChat con límitesPlus: mejores modelos, más usoPro: el uso más intensivo, los niveles superiores
GeminiChat en las apps de GooglePlan de IA de Google: Gemini en WorkspaceEl nivel superior incluye almacenamiento y vídeo
MuseEl agente, con límitesStandardPlan superior
GrokBásico a través de XX Premium+SuperGrok Heavy
DeepSeekTodo——

Lo que compras con los 20 $ no es un cerebro mejor. En todos los laboratorios, el plan gratuito usa el mismo modelo, o casi, con un tope de uso. El de pago quita el tope y, en Claude y OpenAI, desbloquea los agentes. El trabajo con agentes gasta el uso mucho más rápido que el chat, y para eso existen los planes de 100 $ o más.

Lo que miden de verdad las clasificaciones

Verás titulares que dicen que el modelo X «ha ganado» al modelo Y. Así se leen.

  • Las tablas de lanzamiento de cada empresa comparan su nuevo modelo con los rivales en pruebas que elige ella, con la configuración que elige ella. Sirven para saber en qué se ha centrado el laboratorio. No sirven para declarar un ganador.
  • Los índices independientes (Artificial Analysis, LMArena) pasan todos los modelos por las mismas pruebas. Mejor, pero «el mejor en general» sigue escondiendo que uno gana en código, otro en escritura, otro en velocidad y otro en precio.
  • Los índices de agentes (SWE-bench, Terminal-Bench y similares) miden si un modelo es capaz de terminar trabajos reales de varios pasos. Son los que más importan para todo lo de esta serie, y Claude ha liderado la mayoría durante 2026.
  • La clasificación cambia cada mes. Fable 5.1 se puso en cabeza del índice principal el 1 de septiembre; GPT-6 llegó dos días después. El que lidere cuando leas esto puede no liderar el mes que viene.

La regla práctica: los cinco mejores modelos son lo bastante buenos para casi cualquier cosa que hace una persona normal. Elige por lo que no cambia (dónde vive, cuánto cuesta, cómo se comporta cuando no está seguro), no por la puntuación de este mes.

Las pegas, todas juntas

Tus datos. Muse Contributor entrena con tus prompts. DeepSeek en su versión alojada los guarda en China. El plan gratuito de cualquier laboratorio tiene condiciones de datos más laxas que el de pago. Revisa el ajuste una vez; la mayoría te deja desactivarlo.

Rechazos. Claude Fable rechaza a propósito ciertas peticiones peligrosas. Los modelos chinos esquivan la política. ChatGPT tiene su propia lista. Si un modelo se niega a algo normal, suele ser un problema de cómo lo has pedido, no de capacidad.

Alucinaciones. Todos alucinan. La diferencia es si el modelo te dice que no está seguro. Es el punto más fuerte de Claude y el motivo por el que mueve tantos agentes sin supervisión.

Dependencia. Tu historial, tus proyectos y tu memoria se quedan en un laboratorio. Cambiarse es posible, pero pesado. Elige el principal teniéndolo en cuenta.

Topes de uso. Los planes de 20 $ son generosos para chatear y justos para agentes. Si Cowork o ChatGPT Work es tu herramienta de cada día, cuenta con el plan de 100 $.

Regulación. Los gobiernos ya encienden y apagan modelos. Fable 5 estuvo suspendido brevemente en junio por una orden de control de exportaciones de EE. UU. antes de volver. Habrá más casos, no menos.

Puede que no tengas que elegir

Hay dos cosas que hacen la pregunta más fácil de lo que parece.

Primero, los agentes eligen por ti. OpenClaw, Paperclip y la mayoría de las plataformas de agentes te dejan conectar cualquier modelo con una clave de API y cambiarlo en un minuto. Polsia eligió Claude Opus por ti. Copilot Cowork eligió Claude por ti. Grok Bot eligió Grok. Si usas un agente en lugar de una app de chat, la decisión del modelo ya está casi tomada.

Segundo, existen los enrutadores. Los servicios que se sitúan delante de varios modelos y mandan cada tarea al que ofrece mejor relación calidad-precio ya son algo corriente, y la mayoría de las herramientas para desarrolladores lo hacen por defecto. La mejor IA de 2026 es, cada vez más, una política de enrutado, no una sola marca.

Glosario

Familia de modelos
: la gama de modelos de un laboratorio a distintos precios: Claude (Fable, Opus, Sonnet, Haiku), GPT (Astra, Sol, Terra, Luna), etcétera. Las familias son estables; los números de versión, no.
Modelo puntero
: un modelo en la vanguardia de lo posible. Fable, GPT-6, Gemini 3.8 Pro, Muse Spark, Grok 4.6, DeepSeek V4 Pro.
Flash / mini / Haiku
: el nombre que da cada laboratorio a su nivel rápido y barato. Suficiente para la mayoría de las tareas del día a día.
Token
: la unidad en la que se facturan los modelos. Más o menos tres cuartos de palabra. Los precios de la API se dan por millón de tokens, de entrada y de salida.
Pesos abiertos
: un modelo que puedes descargar y ejecutar tú. DeepSeek, Qwen, Kimi, GLM, Mistral, Llama.
Clasificación / índice
: una clasificación independiente de modelos con pruebas comunes. Artificial Analysis y LMArena son los más citados.
Índice de agentes
: un benchmark que mide si se terminan tareas reales de varios pasos, no si se responden preguntas: SWE-bench, Terminal-Bench.
Enrutador (router)
: un servicio que manda cada petición al modelo mejor o más barato para ella.
Nivel Contributor
: el precio rebajado de Muse a cambio de que Meta entrene con tus prompts.

Ya has elegido modelo. Esto es lo que puedes hacer con él.

Consigue el resto de la serie

Todas las guías WTF Agents se escriben igual: lenguaje claro, sin humo y sin jerga. 7 € cada una, o llévate un pack.

Para seguir

5 guías
Consigue la guía en PDF · 7 €