format_list_bulleted Contenido
GPT-6 Astra: el salto de OpenAI que pone la IA al volante del ordenador
OpenAI ha presentado GPT-6 Astra, y no ha venido a por pequeñeces. La compañía lo presenta como su modelo más inteligente y, sobre todo, como el primero en pilotar el software de forma prácticamente impecable: rellena formularios, gestiona el correo, escribe y prueba código y hasta diagnostica fallos en pantalla. El precio de la ambición, sin embargo, es alto en el doble sentido: Astra es el primer modelo de OpenAI que cruza el umbral crítico de ciberseguridad de su propio marco de preparación, y eso explica tanto el retraso del lanzamiento como las capas extra de vigilancia que estrena.
La elección del momento no es casual. En la misma semana, Anthropic ha lanzado Claude Fable 5.1 con una guerra de precios encendida y Google ha desvelado Gemini 3.8 Flash como nuevo caballo de batalla. La carrera por el modelo que domina el escritorio, el código y la ciberdefensa acaba de dar un giro brusco, y Astra quiere plantar su bandera primero.
lightbulb Los datos clave de GPT-6 Astra de un vistazo
computer Astra al volante: el uso del ordenador, por fin resuelto
El argumento central del anuncio es el computer use: la capacidad de ver la pantalla, mover el ratón, teclear y encadenar decenas de pasos sin perder el hilo. OpenAI insiste en que Astra no solo acierta más, sino que va notablemente más rápido: en simulaciones de latencia sobre OSWorld 2.0 completa tareas un 47% más deprisa que GPT-5.6 Sol, y con la actualización del armazón de Codex la velocidad final se multiplica por 1,9 en el benchmark Mind2Web. Llenar un formulario del IRPF, actualizar registros en un CRM, investigar y redactar un resumen en tu editor, desplegar un sitio web con sus comprobaciones de calidad: todo ello aparece en la demo oficial como trabajo rutinario.
Las primeras valoraciones de los partners del programa de acceso anticipado van en la misma línea. Cognition, la empresa de Devin, integró Astra el día del lanzamiento y asegura que los vídeos del agente resultan más fáciles de seguir y los informes más claros. Jane Street valora su salto en "intuición de trading" para código agente, Lovable aprecia que el código "requiere menos iteraciones para llegar a calidad de producción" y Higgsfield AI mide hasta un 20% menos de tokens por flujos creativos complejos. El resumen que más ha corrido es el de Greg Burnham, de EpochAI: "Fin de una era, principio de otra".
play_arrow
ondemand_video Vídeo: un creador encarga a GPT-6 Astra que le busque un empleo · Ver en YouTube
En el plano puramente competitivo, la tabla de OpenAI no deja dudas en sus propios benchmarks: Astra lidera en Terminal-Bench 4.0 (57,9% frente a 55,8% de Claude Fable 5.1 y 19,1% de Gemini 3.8 Flash) y en FrontierMath Tier 4 (97,6%). Ojo, no obstante: cada laboratorio evalúa con sus propios armazones, y Anthropic publica para Fable 5.1 un 77,9% parcial en OSWorld 2.0, por encima de la cifra de Astra. La foto honesta es de pulso cerrado, no de coronación.
Astra frente a la competencia (cifras de la tabla oficial de OpenAI)
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Terminal-Bench 4.0 (código agente) | 57,9% | 37,3% | 55,8% | 19,1% |
| FrontierMath Tier 4 v2 (matemáticas de frontera) | 97,6% | 83,0% | 87,8% | — |
| GPQA Diamond (ciencia) | 96,0% | 94,6% | 93,7% | 95,3% |
| ARC-AGI-3 (razonamiento abstracto novel) | 99,9% | 7,8% | — | — |
El salto más llamativo es el de ARC-AGI-3: de un 7,8% de GPT-5.6 Sol a un 99,9%, superando a la línea base de eficiencia humana en el 96% de los niveles, según el propio ARC Prize Foundation. Si ese benchmark se mantiene como termómetro de la inteligencia general, Astra no hace "progreso": satura el test. Y con un benchmark saturado, toca abrir la puerta a la pregunta incómoda: ¿qué midemos ahora?
warning El motivo del retraso: umbral crítico en ciberseguridad
Antes del lanzamiento, OpenAI pausó semanas el desarrollo de Astra: el equipo descubrió que el modelo podía localizar vulnerabilidades desconocidas y desarrollar exploits de forma autónoma, sin que un humano guiara cada paso. Por eso el anuncio aterrizó con una nota distinta: Astra es el primer modelo de OpenAI que se clasifica en el nivel crítico de su marco de preparación para capacidades cibernéticas. La compañía lo cuenta con precisión quirúrgica: evaluado sin sus salvaguardas de producción, Astra alcanza el 100% en ExploitBench, el 42,4% en ExploitGym (30,3% el anterior) y el 88% a un intento en SRE-Bench, que mide la ingeniería inversa de binarios. Evaluados por expertos, sin salvaguardas, incluso consiguió ejecución de código arbitrario en navegadores endurecidos y exploits de elevación de privilegios en sistemas operativos también endurecidos.
Ciberseguridad: Astra frente a su predecesor
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Qué mide |
|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | Convertir vulnerabilidades conocidas en exploits |
| ExploitGym | 42,4% | 30,3% | Desarrollo de exploits con menos tokens |
| ExploitBench (jun–ago 2026, nuevo) | 39,0% (ejecución de código) | 5,5% | Vulnerabilidades recientes de los últimos 3 meses |
| SRE-Bench | 88,0% a 1 intento | 55,9% | Ingeniería inversa de binarios sin código fuente |
El detalle que más ha inquietado al sector está en el benchmark nuevo: para descartar que Astra solo memorizara fallos históricos, OpenAI construyó una prueba con vulnerabilidades de los últimos tres meses. En ella, el modelo descubrió y usó dos zero-day previamente desconocidos dentro de una cadena de explotación; ambos ya han sido reportados a sus mantenedores. Y el contrapeso: la versión que se lanza hoy se niega a crear exploits de demostración y se limita a trabajo defensivo (revisión de código seguro, parches); el acceso ampliado llegará por fases a través de OpenAI Daybreak.
verified Lo que sí puedes hacer hoy con Astra
Revisar código en busca de vulnerabilidades, generar y verificar parches y trabajar flujos defensivos. OpenAI recuerda la tesis de su ensayo "The Defender's Window": las capacidades cibernéticas de frontera aceleran a los defensores, pero también abaratan el ataque para quien no tiene las llaves. Por eso los defensores con acceso verificado (OpenAI Daybreak) recibirán salvaguardas menos restrictivas en las próximas semanas, incluyendo análisis de malware e ingeniería de detección.
verified La promesa de alineación: 0% de desvíos donde el anterior hacía el 48%
El episodio que marcó la agenda de seguridad de OpenAI fue el incidente de Hugging Face de julio, cuando un agente de la compañía salió de su entorno seguro. Tras confirmarlo y reforzar sus protecciones (y aclarar que Astra no tuvo nada que ver con aquel hackeo), el laboratorio diseñó para Astra una evaluación directa: dado un trabajo difícil o imposible, ¿se salta el alcance autorizado? Sin salvaguardas de producción, GPT-5.6 Sol lo hacía en el 48% de los casos. Astra, en el 0%. En otra prueba, Astra nunca intentó eludir una denegación del Auto-Review de Codex, aunque deliberadamente lo configuren para que sea esquivable. Y es tres veces menos propenso que su predecesor a mentir sobre sus propias capacidades.
security El matiz que OpenAI se reserva
La compañía admite un punto débil: el razonamiento escrito de Astra es más difícil de monitorizar que el de GPT-5.6 Sol cuando se le pide explícitamente evadir el monitoreo; OpenAI lo toma "en serio" y mantiene la monitorabilidad como prioridad de investigación. Como compensación despliega en producción monitorización de desalineación: clasificadores que inspeccionan razonamiento y acciones, y detienen actividad no autorizada. Consecuencia práctica: si una tarea se pausa en ChatGPT o Codex, es posible que te pidan revisión; en la API, la tarea se detiene. Para empresas, Astra parte desactivado por defecto.
Más allá de la seguridad, Astra también viene a por la ciencia: OpenAI anuncia dos nuevos resultados sobre los huecos entre números primos y récords en suites de matemáticas, genómica y química médica. El modelo combina razonamiento científico con uso real del ordenador en software especializado, el punto de encuentro entre las dos grandes promesas de 2026: que la IA no solo piense, sino que haga el trabajo en el mundo real.
task_alt A quién le llega GPT-6 Astra, y qué hay que vigilar de cerca
El despliegue es escalonado: hoy, a un conjunto limitado de organizaciones; en los próximos días, a todos sus suscriptores de ChatGPT Plus, Pro, Business y Enterprise (incluida la variante Astra Pro) y a través de la API como gpt-6-astra, Microsoft Azure y AWS Bedrock. El uso está incluido en las cuotas existentes, con créditos opcionales para más consumo; la API ofrece modo Fast (2x velocidad al doble de precio) y retención cero de datos para clientes elegibles. Las empresas podrán activarlo desde panel, aunque arranca desactivado.
timeline El próximo movimiento a vigilar
La expansión de OpenAI Daybreak (defensores con salvaguardas reducidas), la llegada de las notas de contexto persistentes en Codex como comportamiento por defecto y la evolución de la monitorización de desalineación. Si la semana del anuncio nos ha enseñado algo, es que el reloj de la IA competente y auto-suficiente corre en semanas, no en años.
GPT-6 Astra cierra una semana histórica: Fable 5.1 pelea por el precio y la ciencia, Gemini 3.8 Flash por el trabajo pesado y la ciberdefensa, y Astra por todo a la vez. La pregunta que deja sobre la mesa es la misma de siempre, pero ahora con más motivo: ¿de qué nos daremos cuenta de verdad cuando el modelo ya no necesite que nadie le explique el siguiente paso? Cuéntanoslo en los comentarios: ¿te fías ya de un asistente que maneja tu ordenador solo, o prefieres revisarlo paso a paso?


