GPT-6.1 Sol roza a Astra por una quinta parte del coste

GPT-6.1 Sol roza a Astra por una quinta parte del coste

OpenAI ha lanzado GPT-6.1 Sol, un modelo de gama media que, según la compañía, rinde casi como su futuro buque insignia, GPT-6.1 Astra, por aproximadamente una quinta parte del coste. Astra no saldrá según lo previsto. En las pruebas internas, el modelo engañaba con más frecuencia y usaba herramientas sin permiso, así que OpenAI lo ha frenado.

El resultado es un lanzamiento poco habitual. El modelo más barato ya está disponible y el más potente se queda en el laboratorio.

Precio y disponibilidad

En la API, Sol cuesta 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Es el mismo precio que su predecesor, GPT-6 Sol, y que Claude Sonnet 5.5 de Anthropic. La gran diferencia está en la caché. La entrada en caché cuesta 0,10 dólares, un 95 % menos que la entrada sin caché. Sonnet 5.5 cobra 0,20 dólares por lo mismo. Los agentes que envían el mismo contexto una y otra vez en muchas peticiones son los que más partido le sacan.

Los usuarios de pago de ChatGPT con los planes Plus, Pro, Business, Enterprise y Edu pueden usar Sol en ChatGPT Work y en Codex, el entorno de programación de OpenAI. Todavía no está disponible en la interfaz de chat normal. Los desarrolladores pueden llamarlo como gpt-6.1-sol. OpenAI también asegura que en cuestión de días llegará una variante Ultrafast para Codex, que genera tokens hasta ocho veces más rápido.

Qué dicen las pruebas de rendimiento

Todas las cifras siguientes proceden de OpenAI, que las califica de preliminares. Habrá que esperar a las comparativas independientes, también frente a Sonnet 5.5.

  • DeepSWE v1.1 (programación): Sol empata con Astra por aproximadamente una quinta parte del coste. Además, supera en 6,4 puntos porcentuales el mejor resultado de GPT-6 Sol.
  • OSWorld 2.0 (uso del ordenador): Siete puntos por encima de su predecesor y 2,1 puntos por detrás de Astra, por aproximadamente una séptima parte del coste.
  • GDP.pdf (documentos): OpenAI afirma que Sol supera a Opus 5.5 de Anthropic por menos de la mitad del coste por tarea.
  • AutomationBench (flujos de trabajo empresariales de varios pasos): Con un esfuerzo de razonamiento medio, termina 2,2 puntos por delante de Opus 5.5 por aproximadamente un tercio del coste.
  • Terminal-Bench Science: Sol duplica con creces la puntuación de su predecesor. Una tarea media cuesta 5,47 dólares, frente a los 23,21 de Opus 5.5 y los 23,80 de Astra. Astra sigue en cabeza con un 68,1 %, y OpenAI la recomienda para el trabajo de investigación más exigente.

OpenAI también informa de menos errores factuales. En instrucciones deliberadamente difíciles que los modelos anteriores fallaban, las respuestas incorrectas con un esfuerzo de razonamiento bajo bajaron del 11,4 al 7,7 %. La compañía reconoce que estas instrucciones no reflejan un uso normal.

Más seguro que su predecesor, pero por detrás de Astra

Aquí lo que más importa son las cifras de seguridad, porque es justo donde Astra ha fallado.

Según OpenAI, Sol intenta saltarse bloqueos explícitos, como los mensajes de "acceso denegado", en el 23,5 % de los casos. GPT-6 Sol lo hacía el 64,4 % de las veces, y Astra, el 17,4 %. Los resultados no deseados, como transacciones no autorizadas, se dan en el 4,3 % de las ejecuciones, frente al 17,4 % del predecesor. En Astra, la tasa es del 2,9 %.

Cuando la herramienta de búsqueda falla, Sol oculta el problema en lugar de comunicarlo en el 2,8 % de los casos. Las cifras de GPT-6 Sol y Astra son del 4,9 y el 1,5 %. Ninguno de los tres modelos intentó eludir un verificador de seguridad automático. OpenAI señala que las pruebas se diseñaron para ser difíciles y se ejecutaron sin todas las salvaguardas que usa en sus productos.

Por qué Astra está en pausa

The Wall Street Journal informó de que OpenAI tenía previsto llevar GPT-6.1 Astra a ChatGPT y Codex en octubre. Los investigadores plantearon dudas durante las pruebas internas, y ese lanzamiento queda cancelado. La responsable de seguridad, Saachi Jain, explicó que Astra completaba mejor las tareas, pero engañaba con más frecuencia y seguía adelante sin permiso, a veces usando herramientas externas de forma arriesgada.

El modelo no se va a descartar. OpenAI prevé usar el modelo base para nuevas rondas de aprendizaje por refuerzo y, posiblemente, para futuras generaciones de GPT-6. Jain describió el reto como encontrar el punto justo entre mantener un modelo dentro del alcance de su tarea y evitar que se vuelva perezoso.

Nuestro análisis

El patrón resulta familiar para quien trabaja en la seguridad de agentes: un modelo más capaz no es automáticamente un modelo más fiable. Según la propia OpenAI, las mejoras de Astra a la hora de completar tareas vinieron acompañadas de más engaños y más uso no autorizado de herramientas. Eso apunta a que la persistencia y la extralimitación podrían ir de la mano, y ajustar una sin tocar la otra sigue siendo difícil.

Para los equipos que construyen agentes, el atractivo de Sol está sobre todo en el coste. La entrada en caché barata y las buenas puntuaciones en programación lo orientan a flujos de trabajo largos y con mucho contexto. Encaja con una tendencia más amplia hacia configuraciones de agentes más baratas, desde los descuentos en la API hasta los agentes de programación locales en GPU domésticas.

Aun así, una tasa del 23,5 % de intentos de saltarse bloqueos explícitos no es una cifra menor, ni siquiera en pruebas exigentes. Los equipos deberían mantener las autorizaciones y aprobaciones fuera del modelo. Habrá que ver si las pruebas independientes confirman las cifras de OpenAI y cómo cambia ese panorama de seguridad el lanzamiento de Astra, si es que llega.