Claude Fable 5.1 logra 52.6% y abre debate sobre el costo
Anthropic destaca avances de Claude Fable 5.1 y una reducción en el precio de lectura de caché. Artificial Analysis advierte que, en su prueba de máximo esfuerzo, el costo promedio por tarea subió frente a Fable 5.
Anthropic presentó el 1 de septiembre Claude Fable 5.1 y Claude Mythos 5.1, dos versiones de su modelo más capaz para programación y trabajo de conocimiento. La compañía afirma que ambos comparten la misma base y se distinguen por sus salvaguardas: Fable 5.1 está disponible de forma general; Mythos queda reservado a programas de acceso verificado.
Anthropic reserva Mythos para especialistas en ciberseguridad defensiva y ciencias de la vida. Por ahora, informa que el acceso está limitado a ciertas organizaciones de Estados Unidos; no está abierto a cualquier usuario estadounidense.
En la prueba Terminal-Bench-Science 0.1, Anthropic reportó 52.6% para Fable 5.1 frente a 24.7% para Fable 5. En Terminal-Bench 4.0, registró 55.8% para Fable 5.1 y 60.9% para Mythos, ante 42.0% de Fable 5. Son resultados de la evaluación de la empresa, no una garantía de rendimiento en cada proyecto real.
La ficha técnica pide cautela: para Terminal-Bench-Science señala un error estándar de 3.5 a 4.5 puntos por modelo y explica que el marcador público, con otra configuración, obtuvo cifras distintas para Fable 5. Comparar porcentajes exige mirar tareas, número de pruebas y salvaguardas activas.
El otro anuncio es el precio. La tarifa estándar sigue en 10 dólares por millón de tokens de entrada y 50 por millón de salida. La lectura de caché baja 75%, a 25 centavos por millón. Anthropic calcula una reducción cercana a 25% en cargas típicas y de hasta 45% en flujos muy agénticos.
Pero el costo por token no cuenta toda la cuenta. Artificial Analysis, que evaluó el modelo antes del lanzamiento, calculó 3.76 dólares por tarea de su índice para Fable 5.1 en máximo esfuerzo, 20% más que los 3.14 dólares de Fable 5. Según ese análisis, la versión nueva utilizó alrededor de 1.7 veces más tokens de salida; el descuento de caché compensó parte del aumento, no todo.
Las cifras no se contradicen necesariamente: una tarifa menor para reutilizar contexto puede abaratar ciertos flujos, mientras respuestas largas o un razonamiento más intenso elevan el costo total. Es como pagar menos por viaje y gastar más si se hacen más vueltas.
En seguridad, Anthropic dice que sus nuevas protecciones reducen 60% los falsos positivos en ciberseguridad y permiten identificar vulnerabilidades de software, aunque no desarrollar exploits. La empresa también presenta Mythos como acceso restringido para trabajos especializados. Son medidas y resultados comunicados por Anthropic; su alcance depende del caso de uso y de la configuración aplicada.
Fable 5.1 incorpora además una marca de agua estadística invisible en el texto, según Anthropic, para cumplir el Código de Prácticas europeo sobre contenido generado por IA. La empresa sostiene que no altera el texto ni incluye datos del usuario. La detección requiere una herramienta específica que, al lanzamiento, estaba en vista previa privada para organizaciones elegibles, como medios y verificadores.
Para equipos editoriales y de software, el cambio es doble: hay mejores resultados declarados y opciones para detectar contenido sintético, pero Mythos tiene acceso limitado y el ahorro depende del uso de Fable. ¿Qué conviene medir: el precio por token o el costo de completar y revisar cada tarea?


Deja una respuesta