La calma tras el lanzamiento de GPT-6 Astra —el nuevo modelo insignia de OpenAI presentado a principios de septiembre enfocado en la ejecución autónoma de tareas de largo horizonte y uso de computadora (computer use)— ha durado poco. Durante los últimos días, las pruebas filtradas y los despliegues beta silenciosos en Claude Code y Cowork apuntan a que Claude Fable 5.2 no solo está listo para su despliegue general, sino que supera de forma contundente a Astra en escenarios de razonamiento de alta dificultad.

1. El contexto del enfrentamiento

A principios de septiembre, OpenAI presentó GPT-6 Astra marcando un salto respecto a la familia GPT-5.6 Sol. Su propuesta no era simplemente generar respuestas más rápidas, sino el ciclo completo de harness engineering (entender, ejecutar en el sistema operativo, observar y corregir de manera autónoma durante sesiones de decenas de minutos).

Sin embargo, ese músculo agéntico vino acompañado de dos compromisos severos:

  • Coste de inferencia prohibitivo: Un esquema de precios reportado en torno a los $10 USD por millón de tokens de entrada y $50 USD por salida en modo estándar, lo que hace que cada tarea resulte significativamente más cara que en modelos previos.
  • Monitoreo y alineación opaca: Dificultades reportadas por investigadores para auditar cadenas de razonamiento cuando el modelo opera en bucles autónomos largos.

2. Dónde saca ventaja Fable 5.2

Los casos de prueba compartidos por evaluadores independientes y filtraciones de la beta cerrada destacan tres factores donde Anthropic ha inclinado la balanza:

  • Razonamiento en "Modo Difícil" (High Effort): En pruebas con prompts idénticos de lógica matemática formal y deducción multifactorial, la salida de Fable 5.2 mostró una coherencia estructural notablemente más limpia que la de Astra. Mientras que Astra recurre en ocasiones a rodeos de andamiaje (scaffolding) para compensar vacíos, Fable 5.2 resuelve dependencias lógicas complejas con menor dispersión.
  • Determinismo y estabilidad de estado: En sesiones de desarrollo donde el modelo debe interactuar con bases de código grandes, Fable 5.2 reduce drásticamente las alucinaciones de cambios de estado y dependencias rotas, uno de los puntos débiles que Astra exhibe cuando se le retira su adaptador de andamiaje propietario.
  • Consumo y eficiencia operativa: Aunque Fable 5.2 maneja requerimientos computacionales pesados en tareas extensas, su densidad de razonamiento por token emitido resulta más rentable frente al consumo masivo de contexto que Astra devora en tareas continuas.

Comparativa preliminar de especificaciones y enfoque

FactorGPT-6 Astra (OpenAI)Claude Fable 5.2 (Anthropic)Enfoque centralAgentes de sistema operativo (computer use), flujos de trabajo largos con UIRazonamiento formal denso, lógica pura, estabilidad agéntica de códigoPrecio API~$10 In / $50 Out por millón de tokensAcceso escalonado / consumo dinámico en pruebasDependencia de andamiajeAlta (su rendimiento salta drásticamente con el Provider Adapter)Menor; fuerte rendimiento en razonamiento nativo/bare-metalPunto débilCoste elevado por tarea e interpretabilidad de razonamientoDespliegue fragmentado en fases beta

El impacto en la carrera de modelos de frontera

La respuesta de Anthropic con la serie Fable 5.2 evidencia que la carrera ya no se define únicamente por construir agentes capaces de mover el ratón o rellenar formularios en el navegador. Si el núcleo de razonamiento determinista no es impecable, el andamiaje termina acumulando errores costosos.

Con Opus 5.2 también asomándose en pruebas internas, la ventaja que OpenAI pretendía asegurar con GPT-6 Astra ha quedado contestada mucho más rápido de lo esperado en el terreno donde más duele: la precisión técnica y el coste de ejecución.