Tecnología
Salió Claude Opus 5: en qué se diferencia de Opus 4.8 y de Fable 5
Claude Opus 5 es el modelo actual de la línea Opus de Anthropic: mejor en programación y en tareas largas y autónomas, al mismo precio que Opus 4.8 (5 dólares por millón de tokens de entrada y 25 de salida). Fable 5 es el modelo más capaz que Anthropic ofrece de forma amplia, pero cuesta el doble y no siempre conviene. La diferencia práctica no es cuál es «más inteligente», sino cuál se justifica para cada tarea.
Primero, qué es un token y por qué importa el precio
Un token es un pedazo de texto: aproximadamente tres cuartos de una palabra. Los modelos de IA se cobran por token, y por separado: lo que entra (tu pregunta más el contexto) y lo que sale (la respuesta).
Por eso los precios se ven como «5 / 25 por millón»: cinco dólares por cada millón de tokens que entran, veinticinco por cada millón que salen. La salida cuesta más porque es lo que el modelo genera.
Para dimensionarlo: un millón de tokens son más o menos 750.000 palabras. Una conversación normal de un agente de atención al cliente consume una fracción mínima de eso. Donde el consumo se dispara es en tareas largas y automáticas, que es justo donde estos modelos nuevos cambian el cálculo.
Claude Opus 5: lo nuevo
Es el sucesor de Opus 4.8 en la línea Opus y cuesta lo mismo: 5 dólares por millón de tokens de entrada y 25 por millón de salida. Mantiene la ventana de contexto de un millón de tokens y hasta 128 mil tokens de respuesta.
Lo que cambió de fondo: razona por defecto. En Opus 4.8, si no le pedías explícitamente que razonara, respondía directo. Opus 5 razona salvo que se lo apagues, y apagarlo solo se permite en los niveles de esfuerzo más bajos. En la práctica esto significa respuestas mejores en tareas difíciles, y un consumo de tokens algo mayor si no se ajusta la configuración.
Donde más se nota la mejora es en programación con agentes y en tareas largas y autónomas: refactorizaciones de varios archivos, trabajos que corren durante horas sin supervisión. En ediciones simples de un solo paso la diferencia con Opus 4.8 es menor.
Un detalle que suena técnico pero abarata las cosas: bajó el mínimo para reutilizar contexto en caché de 1.024 a 512 tokens. Traducción: prompts que antes eran demasiado cortos para aprovechar el descuento por caché, ahora sí lo aprovechan.
Claude Fable 5: el techo, al doble de precio
Fable 5 es el modelo más capaz que Anthropic ofrece de forma amplia. Cuesta 10 dólares por millón de entrada y 50 por millón de salida: exactamente el doble que Opus 5.
Tiene tres particularidades que conviene conocer antes de comprometerlo en un proyecto. Siempre razona, no se puede apagar. Los turnos son largos: una sola petición sobre un problema difícil puede tomar varios minutos, lo que obliga a diseñar la aplicación con eso en mente. Y exige retención de datos de 30 días, así que no está disponible para organizaciones configuradas con retención cero.
Está pensado para el extremo difícil: razonamiento profundo, trabajo autónomo de largo horizonte, entregables complejos de principio a fin. Para atender clientes por WhatsApp es un desperdicio.
La tabla, sin rodeos
Opus 4.8 — 5/25 por millón. Generación anterior, sigue disponible. No razona salvo que se lo pidas. Buen caballo de batalla si ya tienes todo montado sobre él.
Opus 5 — 5/25 por millón. Mismo precio, mejor en programación con agentes y trabajo largo. Razona por defecto. Es el punto de partida razonable para casi todo.
Fable 5 — 10/50 por millón. El doble de caro. Siempre razona, turnos largos, requiere retención de 30 días. Para lo más difícil, no para el volumen diario.
Los tres manejan un millón de tokens de contexto y hasta 128 mil de respuesta. La diferencia no está ahí.
Qué significa esto para un negocio en Panamá
Tres conclusiones prácticas.
Uno: el modelo más caro no es el que más rinde. Un agente que atiende WhatsApp responde preguntas sobre horarios, precios y disponibilidad. Eso no necesita el modelo más potente del mercado; necesita información bien cargada y respuesta rápida. Pagar el doble por token en ese caso no compra nada.
Dos: donde sí cambia el cálculo es en trabajo autónomo. Tareas que antes requerían que una persona supervisara cada paso ahora se completan solas. Ahí el modelo mejor sí se paga solo, porque la alternativa son horas de una persona.
Tres: el modelo es la parte barata. Un agente que responde mal no falla por el modelo: falla porque nadie ordenó el catálogo, los precios y las políticas del negocio. Ese trabajo no lo resuelve ningún lanzamiento. Lo explicamos en detalle en qué es un agente cognitivo.
Cómo elegimos nosotros
En IstmoDigital no usamos un solo modelo para todo, porque cada canal tiene un requisito distinto.
El chat web y el de WhatsApp priorizan velocidad y costo por conversación: son muchas conversaciones cortas. El agente de voz prioriza latencia por encima de todo, porque en una llamada un segundo de silencio se siente eterno. Las funciones de IA dentro del CRM —resumir un contacto, puntuar intención, redactar un seguimiento— priorizan calidad de razonamiento, porque son pocas llamadas y cada una debe salir bien.
Elegir el mismo modelo para los tres es la forma más rápida de pagar de más en uno y quedar corto en otro.