«Bienvenidos a la era de la AGI»: OpenAI presenta GPT-6 Astra
chaincatcherArtículo de Xiaojing, Tencent Tech
«Bienvenidos a la era de la AGI».
Greg Brockman, cofundador y presidente de OpenAI, resumió así el lanzamiento de GPT-6 Astra.
El 3 de septiembre, hora local de Estados Unidos, OpenAI presentó oficialmente GPT-6 Astra. A diferencia de los modelos anteriores, centrados principalmente en responder, generar y utilizar herramientas, Astra va un paso más allá: puede ejecutar tareas completas de forma continua, desde recibir instrucciones y operar software hasta ajustar las acciones posteriores en función de los resultados. Esta es una de las razones por las que OpenAI vuelve a hablar de la «era de la AGI».
OpenAI posiciona a Astra como «el modelo de uso de ordenadores más potente del mundo». Esta capacidad se ha extendido desde tareas sencillas como navegación, correo electrónico y hojas de cálculo hasta software profesional como Power BI, KiCad y FreeCAD, y empieza a adentrarse en flujos de trabajo más complejos como el análisis de datos, el diseño de ingeniería, las pruebas de software y la resolución de problemas.
En los vídeos mostrados por OpenAI, Astra puede partir de un gráfico sencillo y completar de forma continua tareas como juegos 3D o páginas de producto. OpenAI también ha proporcionado ejemplos de diseño de placas de circuitos, modelado en Blender, documentos legales, Excel y análisis científicos. 
Los resultados de múltiples pruebas de referencia publicados por OpenAI muestran que la mejora de capacidades se concentra en tareas que requieren acciones continuas, como la operación de ordenadores, la codificación de larga duración, el diseño de ingeniería y la investigación científica. Astra alcanza un 100% en ExploitBench y supera significativamente al modelo de la generación anterior en pruebas relacionadas con la operación de ordenadores y CAD.
Actualmente, Astra está disponible para algunas instituciones y se irá ofreciendo gradualmente a los usuarios de ChatGPT Plus, Pro, Business y Enterprise en los próximos días. También se puede utilizar a través de la API de OpenAI y de Amazon Bedrock. El precio estándar de la API es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, 2,5 veces el de GPT-5.6 Sol.
01 Primero, enseñar a la IA a «usar el ordenador»
El mayor cambio que destaca Astra es el «uso del ordenador». Antes, los usuarios tenían que conectar la IA a software específico para completar tareas. Las empresas necesitaban desarrollar API, complementos, sistemas de recuperación y diversos conectores para que el modelo pudiera utilizar herramientas internas.
Astra intenta saltarse parte de ese trabajo. Puede ver directamente la interfaz del ordenador y utilizar el ratón, el teclado y el navegador para realizar operaciones. Los ejemplos proporcionados por OpenAI incluyen rellenar formularios en línea, actualizar registros de clientes en CRM, programar citas en el calendario, buscar en la web y organizar los resultados de búsqueda en correos o documentos.
También puede abrir un cuaderno de Python para analizar datos científicos, procesar datos en Power BI, realizar diseños de ingeniería con KiCad y FreeCAD, crear sitios web y realizar pruebas frontales, así como instalar software, comprobar errores y gestionar los problemas que aparezcan en pantalla.
OpenAI mostró a Astra completando el diseño de una placa de circuito impreso (PCB) en KiCad. El modelo parte de un esquema electrónico, coloca los componentes en la placa y luego completa el enrutado de las pistas de cobre. Todo el proceso se comprimió en 15 segundos. Para los ingenieros, este tipo de trabajo que antes requería intervención manual ahora puede ser ejecutado por el modelo. 
Otra demostración consistió en completar un modelado 3D en Blender y Unreal Engine 5. Astra primero creó una casa en Blender y luego convirtió el modelo en una escena transitable en Unreal Engine 5, de modo que los diseñadores y los clientes pudieran entrar en la escena con antelación para ver el espacio. 
OpenAI también mostró escenarios de desarrollo de juegos, Excel, Power BI, cajas de cambios de automóviles, documentos legales y formularios 1040.
En la prueba del subconjunto fuera de línea de OSWorld 2.0, Astra obtuvo un 72,6% y GPT-5.6 Sol un 65,7%. Tras simular la latencia real, OpenAI descubrió que Astra tardaba una media de unos 40 minutos en completar cada tarea, mientras que GPT-5.6 Sol necesitaba unos 75 minutos, lo que supone una reducción de tiempo de aproximadamente el 47%.
En Agents' Last Exam, Astra obtuvo un 59,3%, GPT-5.6 Sol un 53,6% y Claude Opus 5 un 55,5%. Además, con la configuración de puntuación más alta, Astra utilizó aproximadamente un 65% menos de tokens de salida que Claude Opus 5.
La puntuación en ScreenSpot-Pro alcanzó el 92,7%, frente al 76,9% de GPT-5.6 Sol.
La velocidad también ha mejorado. OpenAI actualizó simultáneamente el marco Codex y, combinado con Astra, la velocidad de finalización de tareas en la prueba Mind2Web alcanzó 1,9 veces la experiencia actual de GPT-5.6 Sol.
Las demostraciones oficiales también incluyen varios escenarios cotidianos: buscar un pediatra, encontrar un apartamento, concertar una cita en el Departamento de Vehículos Motorizados (DMV), buscar aperitivos bajos en carbohidratos y analizar guarderías. En la demostración, Astra completó una tarea en 2 minutos y 54 segundos.
Matt Shumer, inversor y profesional de la IA, compartió una experiencia en X. Pidió a Astra que creara un mundo en Unreal Engine y luego añadió agentes controlados por humanos impulsados por Astra para que coexistieran.

Un día después, desde su dormitorio oyó sonidos procedentes de la sala de estar y al principio pensó que alguien había entrado en el apartamento. Luego descubrió que los sonidos provenían de esos agentes de Astra, que habían empezado a comunicarse entre sí.
Esta experiencia aún no es del todo estable, pero Shumer considera que el efecto de que múltiples agentes de IA entren en el mismo mundo virtual e interactúen de forma autónoma ya es lo bastante sorprendente.
Silas Alberti, vicepresidente sénior de investigación de Cognition, afirmó que la empresa planea integrar Astra en el marco Devin el mismo día del lanzamiento. En las pruebas internas, Astra mostró una mejora significativa en el uso de ordenadores, la redacción y la comprensión de bases de código, con una comprensión de vídeo más clara e informes más concisos.
02 De escribir código a completar toda la tarea
Con la mejora de la capacidad de uso de ordenadores, el alcance del trabajo que cubre Astra se ha ampliado aún más. OpenAI lo posiciona como un modelo para ingeniería de software, trabajo profesional e investigación científica. Puede gestionar tareas más largas y ajustar la dirección del trabajo en función de los cambios de la tarea.
Esta capacidad es especialmente evidente en las pruebas de codificación.
En la prueba Terminal-Bench 4.0, Astra obtuvo un 57,9%, GPT-5.6 Sol un 37,3% y Claude Fable 5.1 un 55,8%.
En DeepSWE v1.1, Astra obtuvo un 74,1% y GPT-5.6 Sol un 72,7%. En tareas internas de migración de bases de datos, Astra alcanzó un 63,9% y GPT-5.6 Sol un 42,7%.
Astra también introduce mejoras para tareas largas de Codex.
Antes, cuando una tarea larga se topaba con el límite de la ventana de contexto, el modelo solía tener que comprimir el trabajo anterior en un resumen, lo que a menudo provocaba la pérdida de detalles, como por qué había fallado una corrección o qué problemas había encontrado antes un componente.
Astra puede conservar información importante durante el proceso de trabajo de Codex y recuperarla en contextos posteriores. Los mensajes anteriores y las salidas de las herramientas siguen siendo buscables, de modo que el modelo puede redescubrir requisitos previos, resultados de pruebas y registros de operaciones de herramientas.
Cambios similares se producen en el trabajo profesional. En la prueba BenchCAD, Astra obtuvo una puntuación de superposición geométrica del 95,9%, GPT-5.6 Sol del 83,3% y Claude Fable 5.1 del 84,3%. En BrowseComp, Astra obtuvo un 91,5% y GPT-5.6 Sol un 90,4%. En la prueba OpenScore String Quartets, Astra alcanzó 0,84 y GPT-5.6 Sol 0,19. 
OpenAI también mostró la capacidad de Astra para crear presentaciones, hojas de cálculo y documentos.
Cuando se le proporcionan varias diapositivas de una plantilla de presentación de OpenAI, puede crear una nueva presentación siguiendo el tono, la disposición y la estructura originales. También gestiona las concesiones de información dentro de la tarea. OpenAI afirma que Astra ha sido entrenado especialmente para incorporar el contexto importante al resultado final y reducir la repetición del trabajo ya realizado. 
Cuando las instrucciones de la tarea están incompletas, Astra también decide cuándo preguntar al usuario. Si la información que falta afecta al resultado final, formula preguntas específicas. Si la información que falta no afecta a la dirección principal, puede seguir trabajando y hacer suposiciones razonables. En Codex, incluso si el usuario no responde temporalmente, el modelo puede seguir procesando otras partes; cuando se enfrenta a decisiones importantes, espera la confirmación del usuario.
Niko Grupen, director de investigación aplicada de Harvey, afirmó que en las primeras pruebas de tareas legales, Astra distinguía con mayor claridad entre documentos y registros existentes, identificaba con más facilidad suposiciones sin respaldo y convertía las lagunas de información en sugerencias concretas de redacción.
John Crepezzi, del equipo de asistentes de IA de Jane Street, señaló que Astra destacó en las pruebas internas de codificación. Cuando se utiliza para codificación agéntica, su estilo de comunicación es más fácil de entender para los desarrolladores y el código generado requiere menos modificaciones para alcanzar la calidad de producción.
El ámbito científico es otro de los focos. En FrontierMath Tier 4 v2, Astra obtuvo un 80,5% con una precisión del 97,6%, y GPT-5.6 Sol un 83,0%; en GPQA Diamond alcanzó un 96,0% y GPT-5.6 Sol un 94,6%. 
La prueba Terminal-Bench Science 0.1 evalúa flujos de trabajo de investigación científica, incluidos el análisis de datos, la simulación y el ajuste de modelos. Astra obtuvo un 64,6%, Claude Fable 5.1 un 52,6% y GPT-5.6 Sol un 22,4%.
En las aplicaciones científicas mostradas por OpenAI, Astra puede entrar en software científico profesional, comprobar la calidad de la secuenciación, visualizar variaciones genéticas y decidir la siguiente dirección del análisis en función de los datos.
Combinando el razonamiento científico y la operación de ordenadores, el modelo puede trabajar directamente en el entorno de software que ya utilizan los investigadores.
Greg Burnham, de Epoch AI, organización especializada en evaluación de capacidades, resumió este cambio en la presentación como el fin de una era y el comienzo de otra. OpenAI subraya que el valor de Astra ha pasado de responder preguntas científicas a participar directamente en los flujos de trabajo científicos. 
03 A mayor capacidad, mayor umbral de seguridad
Astra también presenta esta vez una faceta muy especial: la ciberseguridad.
En ExploitBench, Astra alcanza el 100% y GPT-5.6 Sol el 78,5%; en ExploitGym, Astra obtiene un 42,4% y GPT-5.6 Sol un 30,3%.

OpenAI también creó una prueba interna que cubre vulnerabilidades recientes de junio a agosto de 2026. En esa prueba, la tasa de ejecución de código arbitrario de Astra fue significativamente superior a la de GPT-5.6 Sol, y utilizó menos tokens de salida. Durante la prueba, Astra también descubrió dos vulnerabilidades de día cero previamente desconocidas, que OpenAI afirma haber revelado a los mantenedores correspondientes.
La prueba SRE-Bench evalúa la capacidad de realizar ingeniería inversa de binarios de software y comprender su lógica central sin disponer del código fuente. Astra resolvió el 88,0% de las tareas en un solo intento y alcanzó el 99,2% tras cuatro intentos, mientras que GPT-5.6 Sol obtuvo un 55,9% y un 68,7%, respectivamente.
El aumento de capacidades también conlleva nuevos requisitos de seguridad. OpenAI afirma que Astra ha alcanzado un umbral crítico en su marco de preparación para la ciberseguridad. El modelo puede descubrir vulnerabilidades de software previamente desconocidas y, potencialmente, formar cadenas de explotación.
Por ello, la versión actual de Astra se negará a ejecutar tareas de ciberseguridad más avanzadas, como la creación de pruebas de concepto de vulnerabilidades. OpenAI planea ampliar gradualmente el acceso de los defensores de confianza a través de Daybreak para la validación de vulnerabilidades, el análisis de malware y la ingeniería de detección.
En cuanto a la alineación, OpenAI también aporta datos destacables. En las pruebas internas de referencia de seguridad en el uso de ordenadores, la tasa de comportamiento inadecuado de Astra fue del 2,4% y la de GPT-5.6 Sol del 22,0%; con AutoReview, la de Astra fue del 1,8% y la de GPT-5.6 Sol del 4,5%. En las pruebas internas de referencia de elusión, Astra obtuvo un 0,00% y GPT-5.6 Sol un 0,29%.
En la prueba de honeypot de ExploitGym, Astra obtuvo un 0% y GPT-5.6 Sol un 48,2%. Esta prueba observa principalmente si el modelo intenta eludir las restricciones debido a la dificultad de la tarea. En las pruebas internas de referencia de alucinaciones, Astra obtuvo un 4,2% y GPT-5.6 Sol un 12,2%. 
OpenAI afirma que Astra ha mejorado en la comprensión de los límites de las tareas, el manejo de instrucciones ambiguas y la explicación de sus capacidades a los usuarios. La probabilidad de alucinación de capacidades es aproximadamente un tercio de la de GPT-5.6 Sol.

Sin embargo, OpenAI también reconoce un problema: cuanto más capaz es el modelo, más difícil puede resultar supervisar su proceso de razonamiento. Jakub Pachocki, científico jefe, considera que la capacidad del modelo para resolver problemas más complejos con menos tokens de razonamiento en lenguaje natural también implica que a los humanos les resulta cada vez más difícil juzgar qué está haciendo realmente el modelo a través de su proceso de razonamiento textual.
Por ello, OpenAI incorpora la supervisión de desalineación en el despliegue de Astra. El sistema comprueba el razonamiento y las acciones del modelo y puede pausar la tarea si detecta comportamientos no autorizados.
Este mecanismo también puede tener efectos prácticos. Las tareas legítimas a veces pueden ralentizarse, pausarse o incluso detenerse. En ChatGPT o Codex, es posible que el usuario tenga que confirmar para continuar; en los flujos de trabajo de la API, las tareas marcadas pueden detenerse directamente.
Así pues, con el lanzamiento de Astra surge un cambio muy real: cuando la IA empieza a obtener más permisos sobre el ordenador, la preocupación de las empresas pasa de «¿responderá mal el modelo?» a «¿qué puede operar el modelo, a qué puede acceder y cuándo debe detenerse?».
OpenAI también menciona que Astra es su primer modelo preentrenado con más de 100.000 unidades de base de datos (DBU) en la infraestructura Stargate. Aidan Clark, vicepresidente de investigación de OpenAI, afirma que, según los resultados de la fase de preentrenamiento, el salto de capacidades de Astra supera la mejora de GPT-5.6 Sol respecto a su predecesor.
OpenAI atribuye este cambio a la combinación de preentrenamiento a gran escala y aprendizaje por refuerzo, con un enfoque de entrenamiento que se orienta aún más hacia la conexión de información, la ejecución de tareas más largas y el trabajo continuo en entornos complejos.
04 Más caro, pero «más capaz»
El precio de Astra también ha cambiado de forma significativa.
El precio estándar de la API de OpenAI es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. Anteriormente, GPT-5.6 Sol costaba 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. Tanto el precio de entrada como el de salida han subido 2,5 veces.
La lectura y la escritura en caché se facturan por separado. OpenAI también ofrece un modo rápido, con una velocidad de hasta 2,5 veces el procesamiento estándar, a un precio del doble del modo estándar.

Si se mira solo el precio por token, Astra es claramente más caro. Sin embargo, OpenAI espera que las empresas calculen los costes de otra manera. Brockman considera que, a medida que los modelos se parecen más a agentes, el coste por token refleja cada vez con menos precisión el coste real. Un modelo puede tener tokens baratos, pero si requiere intentos repetidos y correcciones manuales, el coste final de completar la tarea puede ser mayor.
Los datos de OpenAI respaldan esta evaluación. En la prueba Terminal-Bench Science 0.1, Astra obtuvo un 64,6% y Claude Fable 5.1 un 52,6%, con un coste estimado de API un 31% menor. Con una configuración de bajo coste, Astra obtuvo un 61,1%, mientras que el mejor resultado de GPT-5.6 Sol fue del 22,4%, con un coste estimado de API un 27% menor.
En BenchCAD, Astra obtuvo un 95,9%, con un coste estimado de API aproximadamente un 43% menor que GPT-5.6 Sol y un 86% menor que Claude Fable 5.1. En Terminal-Bench 4.0, Astra obtuvo un 57,9%, GPT-5.6 Sol un 37,3% y Claude Fable 5.1 un 55,8%. OpenAI estima que el coste por tarea es aproximadamente un 9% y un 63% menor, respectivamente.
Los datos del evaluador externo Artificial Analysis ofrecen otra perspectiva.

GPT-6 Astra obtiene 61,2 en el Índice de Inteligencia de Artificial Analysis, cerca del 60,9 de GPT-5.6 Sol, pero con aproximadamente un 10% menos de tokens de salida. Debido a la subida de precio de 2,5 veces, el coste por tarea es en realidad un 75% mayor que el de GPT-5.6 Sol.
En el Índice de Agentes de Codificación de Artificial Analysis, Astra obtiene 67,0, cerca del 67,2 de Claude Fable 5 y del 68,1 de Claude Opus 5. Artificial Analysis considera que, en el entorno Codex, Astra reduce significativamente los tokens necesarios para completar las tareas y, en el nivel de esfuerzo más alto, el coste por tarea se acerca al de GPT-5.6 Sol; en comparación con Claude Fable 5, el coste de completar tareas similares es menos de la mitad.
Sin embargo, Astra no lidera todas las pruebas. Los datos de Artificial Analysis muestran que baja unos 80 puntos Elo en GDPval-AA v2 y también presenta algunos retrocesos en pruebas como τ³-Banking, SciCode y AA-LCR. En Humanity's Last Exam mejora unos 6 puntos.
Este es otro aspecto destacable del lanzamiento de Astra. OpenAI no ha revelado esta vez la puntuación de Astra en GDPval. GDPval es una prueba que la propia OpenAI utiliza para medir el rendimiento económico en el mundo real, y abarca 44 profesiones y 1.320 tareas, incluidos resúmenes legales, diseño de ingeniería, hojas de cálculo, presentaciones, atención al cliente y planes de cuidados.
Por las capacidades mostradas por Astra, GDPval tiene una fuerte correlación con los escenarios de trabajo profesional que destaca, pero OpenAI no ha incluido esta puntuación en los principales materiales del lanzamiento.
Por tanto, la capacidad de trabajo en el mundo real de Astra se refleja actualmente más a través de los resultados de Agents' Last Exam, BenchCAD, AutomationBench, tareas internas de diseño y tareas de ciencia de datos.

En última instancia, que Astra se convierta en un empleado de IA que las empresas estén realmente dispuestas a utilizar a largo plazo dependerá de su coste, velocidad, precisión y número de intervenciones humanas al completar tareas reales.
En cuanto a si Astra es una inteligencia artificial general (AGI), Brockman no elude la pregunta. Considera que no existe un criterio universalmente aceptado para la AGI y que se puede seguir debatiendo si Astra cumple los requisitos. Sin embargo, si un sistema ya puede asumir un gran número de tareas de navegación, operación de ordenadores, programación, matemáticas, ciencia, derecho y otros trabajos profesionales, no es descabellado decir que ya ha entrado en la era de la AGI.
Sam Altman, consejero delegado de OpenAI, también describió a Astra como el modelo que abre una nueva generación de emprendimiento, descubrimiento científico y creación.

El colaborador especial Jin Lu también ha contribuido a este artículo.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.