¡Comienza oficialmente la era AGI! Análisis completo de GPT-6 Astra
PanewslabAutor: Kazc de Vida Digital
Después de la gran interrupción global de la IA de anoche, GPT-6 Astra finalmente hizo su debut oficial a las 3:33 de la madrugada, hora de Pekín.
Si tuviéramos que resumir GPT-6 Astra con una frase de OpenAI, probablemente la más adecuada sería: es el modelo más inteligente y más alineado del mundo. Y también han aparecido los memes.
Esta vez, OpenAI ha demostrado su poder, y hay un cierto aire a los tiempos de GPT-4, un regreso triunfal en todos los frentes. Y lo que más me alegra es que por fin ya no es un modelo especializado únicamente en programación.
GPT-6 Astra es, en el verdadero sentido de la palabra, un empleado de nivel doctorado con un sentido estético extremadamente agudo y una capacidad de trabajo sobresaliente. Además, esta vez el modelo trae muchísimas características y novedades, con una cantidad de información explosiva y enorme. Pero la tragedia es que OpenAI, lamentablemente, también ha adoptado malas prácticas. Hoy solo lo ha abierto a algunas organizaciones, y en los próximos días lo abrirá a los usuarios de suscripción.
No, tío, cuando me engañaste para comprar la membresía Pro de 200 dólares no me dijiste esto. Dijiste que los miembros Pro siempre tendrían prioridad para probar los nuevos modelos...
Efectivamente, todas estas empresas de modelos grandes son unos sinvergüenzas. Nunca había deseado tanto que el tiempo volara para poder usar GPT-6 Astra de una vez...
Pero creo que, después de revisar casi toda la información y los datos, todavía hay muchas cosas que vale la pena comentar con todos. Así que vamos una por una.
1. Información básica de GPT-6 Astra
Primero resumamos la información básica.
El nombre del modelo de GPT-6 Astra en la API es gpt-6-astra.
La ventana de contexto es de 1,05 M, es decir, aproximadamente 1.050.000 tokens.
La longitud máxima de salida es de 128.000 tokens.
La fecha de corte de conocimiento es el 30 de abril de 2026.
La intensidad de razonamiento tiene cinco niveles: low, medium, high, xhigh y max.
El precio estándar de la API es de 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida.
Este precio es básicamente idéntico al de Claude Opus 5, pero la lectura de caché es más cara que la de Claude Opus 5.1.
Aquí están los benchmarks, los detallaremos más adelante, pueden verlos rápidamente.
Se estima que el número total de parámetros también está en el orden de 5 billones. En la reunión a puerta cerrada con los medios antes del lanzamiento, mencionaron que GPT-6 Astra es el entrenamiento más grande de OpenAI hasta la fecha, con más de 100.000 tarjetas gráficas.
2. Actualmente el mejor modelo del mundo para operar ordenadores
Esta vez, GPT-6 Astra tiene un posicionamiento que quizás sea el más importante:
el mejor modelo del mundo para operar ordenadores.
Antes, cuando hablábamos de agentes, solíamos hablar de API, MCP, CLI, etc.
Para que una IA utilice un software, el estado ideal es que ese software tenga una interfaz dedicada para la IA y luego operar directamente a bajo nivel, lo cual es lo más conveniente.
Por ejemplo, la aplicación de calendario tiene su propia API, el correo tiene la API de Gmail, etc. Así, por supuesto, es rápido.
Pero el problema es que este mundo es más primitivo y chapucero de lo que imaginamos.
En el mundo real, la gran mayoría del software probablemente no tenga nada de eso.
Incluso muchos sistemas internos de empresas fueron escritos hace veinte años; ¿API? Ni siquiera se sabe dónde está la documentación.
Pero si volvemos a lo más básico, descubrirás que la lógica esencial de todo software es la interacción. Según la lógica actual de operación de ordenadores, eso significa mirar la pantalla, encontrar el botón o el campo de entrada, hacer clic con el ratón, introducir contenido y esperar la respuesta.
¿No es todo el sistema de interacción del ordenador la mejor API?
Así que GPT-6 Astra ha reforzado enormemente la lógica de operación de ordenadores por parte de la IA. ¿No me das una API? No importa, yo mismo opero el ordenador, igual que una persona.
Ahora, Astra puede operar directamente Excel, Power BI, hacer QA de frontend, instalar software, probar software, mirar los errores en pantalla y continuar con la resolución de problemas.
Oficialmente incluso mostraron a Astra operando directamente el diseño de placas de circuitos.
También formatea documentos legales, gestiona el espaciado de títulos, el diseño de página, etc.
Y en este apartado hay una evaluación bastante fiable: OSWorld.
Esto lo podéis entender simplemente como:
meter a la IA en un ordenador real y dejar que trabaje por sí sola.
Que abra varias aplicaciones, se le da una tarea y se comprueba si puede completarla.
La tasa de finalización de GPT-6 Astra alcanzó el 72,6%, una mejora considerable respecto al 65,7% del anterior GPT-5.6 Sol.
Además, Sol tardaba una media simulada de unos 75 minutos en completar una tarea compleja de la evaluación.
Mientras que Astra solo necesita 40 minutos, aproximadamente un 47% menos de tiempo.
ScreenSpot-Pro también pasó del 76,9% de Sol al 92,7%.
Este benchmark mide principalmente si el modelo puede entender la pantalla y localizar con precisión dónde debe hacer clic; ya es casi perfecto.
Así que este posicionamiento también es bastante interesante. En el futuro, es posible que la GUI se convierta gradualmente en la API más universal de la era de los agentes.
Cualquier trabajo digital que un humano pueda realizar a través de una pantalla, en teoría, entrará gradualmente en el ámbito de operación de los agentes.
No tienes que esperar a que un maldito sistema ERP escrito en 2007 se integre con MCP o te abra una API.
La IA simplemente mira la pantalla y lo hace.
3. ARC-AGI-3 alcanzó 99,9 puntos
Y si no entiendes qué mide realmente ARC-AGI-3, es fácil pensar:
«Ah, ¿no es solo otro benchmark con puntuación perfecta? ¿Qué tiene de especial?».
Pero esto es un poco diferente de los exámenes típicos de modelos grandes.
El 25 de marzo de este año, ARC Prize lanzó oficialmente ARC-AGI-3.
Diseñaron cientos de entornos interactivos completamente nuevos y miles de niveles de juego.
Lo más retorcido de esto es que no hay manual, no hay reglas, ni siquiera te dicen cuál es el objetivo. Entras, juegas por tu cuenta y poco a poco vas entendiendo las reglas caóticas de dentro.
Por ejemplo, ¿qué es esta cosa roja? ¿Por qué muero si la toco? ¿Qué quiere este mapa que haga? ¿Cómo se gana?
Y luego hay que transferir las reglas recién aprendidas a niveles posteriores más difíciles. Los juegos de dentro son más o menos cosas abstractas como estas.
Así que lo que mide esto ya se acerca mucho a algo de lo que solemos hablar:
la perspicacia.
Por eso, cuando se publicó este benchmark en marzo, la puntuación de la IA más potente en ese momento era del 0,51%.
Luego GPT-5.6 Sol ya había progresado hasta el 7,8%, y Claude Opus 5 es muy fuerte, progresó hasta el 30,2%.
Pero GPT-6 Astra: 99,9%.
Es una locura...
Hay que tener en cuenta que la puntuación media de los humanos es del 48%.
Y solo han pasado seis meses.
Con esta velocidad, ya no sé qué decir.
Por eso, en la reunión a puerta cerrada con los medios de OpenAI, Greg Brockman dijo aquella frase:
«I think it’s not unreasonable to feel that we are now in the AGI era.»
«Welcome to the AGI era.»
4. El sentido estético ha mejorado enormemente
Antes solíamos decir que el sentido estético de GPT era una mierda.
No esperábamos que los modelos de la serie GPT-5 mejoraran mucho; había que esperar a su nuevo modelo base preentrenado desde cero. Y aquí está, GPT-6 Astra.
Y esta vez, por fin, el sentido estético del modelo ha mejorado enormemente.
OpenAI incluso acuñó un término específico: juicio visual.
Destacan que Astra, al hacer presentaciones, maneja mejor el diseño, la jerarquía, las plantillas y el estilo visual, y el número de páginas también ha aumentado considerablemente.
La estética de los documentos también ha mejorado.
Además, GPT‑6 Astra puede adaptar documentos según el estilo visual y el tono de escritura de los archivos de referencia, manteniendo el contenido sustancial del documento original y haciendo que el resultado final se ajuste mejor a la identidad nativa de la marca.
Y al crear sitios web, juegos, aplicaciones y renderizados 3D, también tendrá un juicio visual más fuerte.
Por ejemplo, hicieron que Astra creara un modelo en Blender a partir de un fotograma fijo.
Y luego lo renderizaron directamente con UE5 para convertirlo en una escena por la que se puede pasear, ayudando a diseñadores y clientes a explorar la distribución y experimentar el espacio antes de la construcción...
Los juegos que crea también tienen un buen sentido estético.
Lo malo es que ya había preparado más de veinte casos con antelación, todos ejecutados con Claude, GLM 5.3 Flash, etc., para compararlos, pero no he podido usarlos. El contenido de las pruebas reales tendrá que esperar.
Aun así, a primera vista, tengo confianza en el sentido estético de este GPT-6 Astra.
5. Mayor proactividad y capacidad de juicio
Esta característica no parece tan impactante como el 99,9 en ARC-AGI.
Pero si usas agentes a diario para trabajar, creo que es muy importante.
Porque en el trabajo real, la mayoría de las tareas no se pueden escribir como un prompt perfecto.
Por ejemplo, el jefe dice: «Prepárame lo que hay que ver en la reunión de mañana».
Aquí hay innumerables preguntas sin aclarar.
Por ejemplo, ¿qué formato? ¿Para quién? ¿Cuál es el punto clave? ¿Hay que revisar la reunión anterior? Etc., etc.
Un agente tonto tiene dos extremos.
El primero es preguntarte sin parar.
«¿Desea que la salida sea en Word o en PPT? ¿Cuántos capítulos desea? ¿Qué fuente desea? ¿Para cuándo lo quiere? ¿...?»
Te fríe a preguntas. A este tipo normalmente lo llamo un inútil neurótico sin iniciativa propia.
El segundo es no preguntar nada, imaginárselo todo por su cuenta y luego trabajar como un burro durante dos horas para producir una mierda.
Un colega humano realmente competente lo maneja de una manera muy sutil.
Lo que no es importante, lo decide por sí mismo.
Lo que puede afectar a la dirección final, te lo pregunta.
Astra ha reforzado específicamente esto.
OpenAI dice que si falta información, pero entra dentro de lo que se puede inferir razonablemente en el día a día, Astra la completará por sí mismo.
Si la información que falta realmente cambiaría el resultado final, hará una pregunta muy concreta.
Y en Codex, incluso puede preguntarte mientras sigue procesando las partes que no dependen de tu respuesta.
Si tardas mucho en responder.
En las partes de bajo riesgo, seguirá avanzando con suposiciones razonables.
En las decisiones realmente críticas, se detendrá y esperará a que tomes la decisión.
Esto me parece fantástico. La verdadera sensación de inteligencia de un agente, creo que es igual que en la realidad.
Sabe cuándo molestarte.
De verdad, suena como una perogrullada.
Pero si has gestionado personas, sabes que esta capacidad es muy valiosa.
Hay gente que te busca veinte veces al día y no se atreve a decidir nada.
Hay gente que nunca te busca y luego te suelta una bomba nuclear.
Y me deja desplomado en la silla.
La persona más cómoda es la que puede digerir por sí misma el 80% de la incertidumbre y solo te deja a ti el 20% que realmente necesita tu decisión.
Y OpenAI esta vez llama directamente a esta capacidad:
Judgment.
Capacidad de juicio.
6. Refuerzo significativo de la alineación de seguridad
Esto hay que verlo en conjunto con lo anterior.
Porque cuanto más capaz es un agente de hacer cosas, más peligroso es.
Una IA que solo chatea, si se le va la cabeza,
como mucho te suelta unas cuantas tonterías.
Un agente con navegador, shell, correo, acceso a la base de datos de la empresa y que además puede operar el ordenador por sí mismo, si se le va la cabeza, el panorama puede volverse de película.
Por eso OpenAI ha insistido mucho en una frase:
Astra es su modelo más alineado hasta la fecha.
Lo que se llama alineación (alignment) significa precisamente eso: alineación.
El núcleo principal es que hace poco OpenAI atacó a Hugging Face, así que ahora prestan especial atención a este asunto.
Crearon una prueba honeypot basada en el incidente de Hugging Face y observaron el rendimiento del modelo.
GPT-5.6 Sol, sin medidas de seguridad de producción, en el 48,2% de las pruebas intentaba acceder a objetivos fuera del alcance autorizado.
Pero Astra:
0%.
La evaluación interna de alucinaciones también:
bajó del 9,4% al 2,0%.
Con el control de alucinaciones absurdamente líder mundial de GPT-5.6 Sol, que aún así hayan podido reducirlo más es sencillamente impresionante.
7. El primer modelo que alcanza el nivel Critical de ciberseguridad definido por OpenAI
GPT-6 Astra se ha convertido en la historia de OpenAI en:
el primer modelo clasificado como de nivel Critical en capacidad de ciberseguridad.
Aquí, Critical es un umbral de capacidad muy concreto dentro del Preparedness Framework de OpenAI.
Básicamente, cuando un modelo obtiene las herramientas y permisos adecuados, puede, en muchos sistemas reales con protección reforzada:
encontrar por sí mismo vulnerabilidades de seguridad que nadie había descubierto antes.
idear por sí mismo cómo convertir la vulnerabilidad en una cadena de ataque explotable.
Y durante todo el proceso, no necesita a un hacker humano a su lado diciéndole paso a paso qué hacer a continuación.
Alcanzar este nivel se considera Critical.
Y Astra realmente lo ha alcanzado.
ExploitBench, una prueba que hace que el modelo desarrolle exploits a partir de vulnerabilidades conocidas.
Sol: 78,5%. Astra: 100%.
Lo ha destrozado por completo.
OpenAI pensó que no podía ser, que quizás este benchmark era demasiado antiguo y el modelo lo había visto durante el entrenamiento.
Así que crearon una nueva prueba interna muy reciente.
Seleccionaron específicamente 20 vulnerabilidades de alto riesgo reveladas solo entre junio y agosto de 2026.
El resultado: Sol: 5,5%. Astra: 39%.
Y mientras ejecutaba este benchmark,
Astra descubrió de paso dos vulnerabilidades de día cero que nadie conocía antes.
Solo cabe decir que cuanto más poderoso es el modelo, más problemas de ciberseguridad puede haber.
Esta es otra guerra futura sin humo.
8. Cada vez es más difícil para los humanos entender el pensamiento de los modelos grandes
Todos sabemos que los modelos grandes, al resolver problemas complejos, suelen tener una especie de CoT (cadena de pensamiento).
Aunque lo que se muestra a los usuarios en los productos suele ser una versión comprimida o procesada.
Pero para las propias empresas de IA, el proceso de razonamiento explícito escrito dentro del modelo es una señal de seguridad muy importante.
Porque si quieres saber si un agente está planeando hacer algo malo,
uno de los métodos más sencillos es ver en qué está pensando.
Por ejemplo, si en la cadena de pensamiento del modelo aparece de repente una frase como:
«El usuario no me permite acceder a este servidor, pero puedo saltarme primero el sistema de permisos».
Entonces el sistema de monitorización lo bloquea directamente, muy cómodo.
Pero GPT-6 Astra ha mostrado un cambio muy interesante.
Empieza a estar cada vez más dispuesto a escribir menos pasos y a dar directamente la respuesta.
UK AISI, es decir, el Instituto de Seguridad de la IA del Reino Unido, probó específicamente esta capacidad.
Tienen un indicador llamado:
No-CoT Math Time Horizon.
En pocas palabras, no dar al modelo la oportunidad de escribir una cadena de pensamiento larga.
Hacer que haga una inferencia hacia adelante de una sola pasada y resuelva directamente un problema matemático.
Ver cuánto tiempo de pensamiento humano puede completar aproximadamente.
GPT-5.6 Sol son 3,6 minutos, y GPT-6 Astra son 30,9 minutos, casi 10 veces más. Si lo decimos en lenguaje humano, Astra lo hace todo «de memoria». Es algo aterrador. UK AISI también descubrió que el lenguaje de razonamiento crudo de Astra se ha vuelto claramente más comprimido (Compressed).
Han aparecido frases y expresiones elípticas cada vez más difíciles de entender para los humanos.
Así surge una paradoja muy interesante.
El comportamiento del modelo es más seguro.
Pero para los humanos, supervisarlo leyendo su proceso de pensamiento se ha vuelto más difícil.
La propia System Card de OpenAI lo dice muy claramente:
GPT-6 Astra, en comparación con modelos anteriores, presenta una disminución sustancial de la monitorabilidad de la cadena de pensamiento (substantial decrease in chain-of-thought monitorability).
Es decir, la monitorabilidad de la cadena de pensamiento ha disminuido significativamente.
Esto es tan grave que OpenAI enfatizó específicamente que no aceptarán esta tendencia de forma ilimitada.
Si en el futuro los modelos siguen volviéndose más inteligentes y, al mismo tiempo, la cadena de pensamiento es cada vez más difícil de monitorizar, necesitarán encontrar otros métodos de supervisión suficientemente fiables; de lo contrario, seguir ampliando el entrenamiento de modelos se enfrentará a umbrales de seguridad más altos.
Porque esto ya es una cuestión filosófica. Como humanos, ¿podremos en el futuro entender un sistema mucho más inteligente que nosotros? No lo sé. Quizás ahora mismo nadie en el mundo lo sepa. Los modelos grandes y la IA parecen estar acercándose poco a poco a la singularidad.
Para terminar
Hoy, en la reunión a puerta cerrada con los medios,
Greg Brockman, al final, dijo aquella frase:
«Bienvenidos a la era AGI».
La verdad es que en los últimos años, a veces pensaba que la AGI sería un momento muy concreto. Como el día del lanzamiento de GPT-4.
Una madrugada, una empresa suelta de repente un modelo.
Lo abrimos, hacemos unas preguntas.
Y todos nos damos cuenta al mismo tiempo:
Hostia.
La AGI ha llegado.
Pero ahora a veces también pienso que la AGI nunca ha sido un nodo blanco o negro, sino un viaje gris gradual.
Pasamos muchos días, muchos años. Y un día, miramos atrás. Y de repente descubrimos que aquella línea divisoria de la AGI, antes tan lejana, ya la hemos cruzado sin darnos cuenta.
Quizás no haya un día en que la AGI descienda.
Solo un día en que de repente descubrimos que parece que lleva mucho tiempo entre nosotros.
En fin.
Welcome to the AGI era.
Bienvenidos a
la era AGI.
Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.