Anthropic ha implementado una estrategia de optimización de costes para sus modelos de inteligencia artificial, específicamente Claude Fable 5.1 y Claude Mythos 5.1, sin alterar los precios base de entrada y salida de 10 y 50 dólares por millón de tokens, respectivamente. La clave de esta reducción radica en una disminución del 75% en el coste de lectura de caché, pasando de 1 dólar a 0,25 dólares. Esta modificación se traduce en una disminución de la factura de aproximadamente un 25% para cargas de trabajo estándar y hasta un 45% en flujos de trabajo agénticos que son intensivos en contexto, sin necesidad de modificar el código existente.

La optimización del coste en detalle

La principal innovación en la estructura de precios reside en la gestión de la caché. En el funcionamiento de un agente de IA, cada paso ejecutado, ya sea leer un archivo, realizar una prueba o corregir, implica arrastrar consigo todo el contexto previamente procesado. La caché es fundamental para evitar pagar duplicadamente por el mismo contexto. Anteriormente, el coste de la caché representaba el 10% del precio de entrada, pero ahora se ha reducido al 2,5%.

Esta rebaja impacta de manera diferencial según el tipo de uso:

  • Los usuarios que realizan consultas puntuales notarán un cambio mínimo, ya que su uso de la relectura de contexto es bajo.
  • Para aquellos que emplean agentes de IA en tareas repetitivas sobre el mismo repositorio durante periodos prolongados, la reducción de costes puede alcanzar hasta un 45% por el mismo volumen de trabajo.

Adicionalmente, el procesamiento por lotes se establece en 5 y 25 dólares por millón de tokens, manteniendo una ventana de contexto de un millón de tokens con un máximo de 128.000 de salida.

Rendimiento y acceso a los nuevos modelos

Anthropic ha compartido métricas de rendimiento para sus nuevos modelos:

  • Fable 5.1: Alcanza un 52,6% en Terminal-Bench-Science 0.1 y un 55,8% en Terminal-Bench 4.0.
  • Mythos 5.1: Logra un 60,9% en Terminal-Bench 4.0 y un 73,4% en CursorBench 3.2.0. En Humanity’s Last Exam, registra un 60,9% sin herramientas y un 65% con ellas.

Es relevante considerar que estas cifras provienen de pruebas internas seleccionadas por el fabricante. Un dato que matiza el entusiasmo es que en OSWorld 2.0, una prueba que mide el manejo autónomo de un ordenador, el modelo completa solo el 41,7% de las tareas bajo evaluación estricta, lo que indica que en más de la mitad de los casos pueden surgir fallos.

Actualmente, Fable 5.1 está disponible de forma general a través de la API de la compañía y en plataformas como Amazon Bedrock, Google Cloud y Microsoft Foundry. Sin embargo, el acceso a Mythos 5.1, que es el mismo modelo con salvaguardas diferentes, está restringido a organizaciones estadounidenses verificadas mediante el Cyber Verification Program para seguridad defensiva y el Life Sciences Verification Program para investigación biomédica, limitando su disponibilidad a empresas europeas.

Mejoras en la experiencia del usuario y gestión de datos

Anthropic ha abordado activamente las quejas de los clientes relacionadas con el coste, la retención de datos y un exceso de bloqueos en peticiones inofensivas. En respuesta a esto, la compañía ha implementado mejoras significativas:

  • Las salvaguardas de biología se activan un 85% menos en consultas benignas.
  • Las salvaguardas de ciberseguridad producen un 60% menos de falsos positivos por sesión.

Ahora, el modelo puede identificar vulnerabilidades en código, una funcionalidad previamente restringida, aunque la generación de exploits y las pruebas de intrusión siguen vetadas.

Respecto a la retención de datos, Anthropic lanzará este otoño Enterprise Frontier Safeguards, un programa que permitirá a los clientes almacenar sus datos en su propia infraestructura de nube, con sus claves de cifrado, y Anthropic solo accederá para el monitoreo de seguridad, sin cargos adicionales más allá del almacenamiento.

Finalmente, se ha implementado un cambio en las cuentas de API creadas después del 31 de agosto de 2026: ya no será posible editar manualmente los turnos anteriores de una conversación, una técnica utilizada para destilar modelos. Además, la funcionalidad de forzar el uso de herramientas con tool_choice con valor any o tool ahora devolverá un error 400.

Es crucial que evalúes el impacto real de estas rebajas en tu factura, especialmente si tu flujo de trabajo no reutiliza contexto de manera intensiva. Te recomiendo medir el gasto antes y después de la implementación.