Эра AGI официально началась! Полный обзор GPT-6 Astra

PanewslabPanewslab

Автор: Цифровая карта жизни Кацзык

После вчерашнего глобального сбоя ИИ. GPT-6 Astra наконец-то официально дебютировал в 3:33 утра по пекинскому времени.

Изображение

Если бы OpenAI нужно было охарактеризовать GPT-6 Astra одной фразой, то, пожалуй, лучше всего подошла бы эта: Это самая умная и самая выровненная модель в мире. И тут же появились мемы.

ИзображениеНа этот раз OpenAI доказала свою силу, и это немного напоминает当年的 GPT-4 — триумфальное возвращение по всем направлениям. И что меня больше всего радует, так это то, что это наконец-то не модель, заточенная исключительно под программирование.

GPT-6 Astra — это в полном смысле слова сотрудник уровня PhD с превосходным эстетическим вкусом и невероятной работоспособностью. И у этой модели действительно очень много новых функций и особенностей, объём информации просто колоссальный. Но, к сожалению, OpenAI, увы, тоже пошла по плохому пути. Сегодня она открыла доступ только некоторым организациям, а подписчикам — только в ближайшие дни.

Изображение

Ну нет, когда ты продавал мне Pro-подписку за 200 долларов, ты же не так говорил. Ты же говорил, что Pro-подписчики всегда первыми получают доступ к новым моделям...

И правда, все эти компании с большими моделями ведут себя нечестно. Я никогда так не хотел, чтобы время шло быстрее, лишь бы поскорее попробовать GPT-6 Astra...

Но, просмотрев почти всю информацию и материалы, я думаю, что есть много чего, о чём стоит поговорить. Давайте по порядку.

1. Основная информация о GPT-6 Astra

Давайте сначала подытожим основную информацию.

Название модели GPT-6 Astra в API — gpt-6-astra.

Контекстное окно — 1,05M, то есть примерно 1,05 миллиона токенов.

Максимальная длина вывода — 128K токенов.

Знания актуальны до 30 апреля 2026 года.

Уровни интенсивности рассуждений: low, medium, high, xhigh, max.

Стандартная цена API: $10 за миллион входных токенов, $50 за миллион выходных токенов.

Эта цена практически полностью совпадает с Claude Opus 5, но чтение из кэша дороже, чем у Claude Opus 5.1.

Изображение

Бенчмарки вот здесь, подробно расскажу позже, пока просто взгляните.

Изображение

Общее количество параметров, по оценкам, тоже на уровне 5T. На закрытой встрече для СМИ перед запуском они упомянули, что GPT-6 Astra — это крупнейшее обучение в истории OpenAI, использовавшее более 100 000 ускорителей.

2. Лучшая в мире модель для управления компьютером

На этот раз у GPT-6 Astra есть, возможно, самое важное позиционирование:

Лучшая в мире модель для управления компьютером.

Раньше, когда мы говорили об агентах, мы часто обсуждали API, MCP, CLI и тому подобное.

Чтобы ИИ мог управлять каким-то программным обеспечением, в идеале нужно, чтобы у этого ПО был специальный интерфейс для ИИ, через который можно напрямую работать на низком уровне — это самый удобный способ.

Например, у календаря есть API календаря, у почты — API Gmail и так далее. Это, конечно, быстро.

Но проблема в том, что мир гораздо более примитивен и кустарно устроен, чем мы себе представляем.

В реальном мире у большинства программ такого просто нет.

Даже многие внутренние корпоративные системы написаны двадцать лет назад — какой там API, даже документацию неизвестно где искать.

Но если вернуться к самой основе, то суть любой программы — это взаимодействие. А по нынешней логике работы с компьютером это: смотреть на экран, находить кнопку или поле ввода, кликать мышью, вводить данные, ждать отклика.

Разве вся система взаимодействия с компьютером не является лучшим API?

Поэтому GPT-6 Astra колоссально усилил логику управления компьютером: не даёте API — не страшно, я сам буду управлять компьютером, как человек.

Теперь Astra может напрямую работать с Excel, Power BI, выполнять фронтенд-QA, устанавливать программы, тестировать их, смотреть на ошибки на экране и продолжать устранять неполадки.

Официально даже показали, как Astra напрямую работает над проектированием печатных плат.

Изображение

А ещё форматирует юридические документы, обрабатывает отступы заголовков, макет страницы и тому подобное.

И здесь есть довольно надёжный бенчмарк — OSWorld.

Его можно упрощённо понимать так:

ИИ помещают в реальный компьютер и дают ему самому работать.

Ему открывают несколько приложений, дают задачу и смотрят, справится ли он.

У GPT-6 Astra процент выполнения достиг 72,6%, что заметно выше, чем 65,7% у предыдущего GPT-5.6 Sol.

При этом Sol на выполнение сложной задачи в бенчмарке в среднем тратил около 75 минут симуляции.

А Astra требуется всего 40 минут — примерно на 47% меньше времени.

ScreenSpot-Pro тоже вырос с 76,9% у Sol до 92,7%.

Этот бенчмарк в основном проверяет, может ли модель понимать экран и точно определять, куда нужно кликнуть, — и теперь это почти идеально точно.

Так что это позиционирование довольно интересное: в будущем, возможно, GUI постепенно станет самым универсальным API эпохи агентов.

Любая цифровая работа, которую человек может выполнить через экран, теоретически постепенно войдёт в сферу действий агентов.

Вам не нужно ждать, пока какая-нибудь древняя ERP-система, написанная в 2007 году, подключится к MCP или откроет вам API.

ИИ просто смотрит на экран и делает.

3. ARC-AGI-3 достиг 99,9 балла

И если вы не понимаете, что именно измеряет ARC-AGI-3, легко подумать:

«О, очередной бенчмарк пройден на максимум, что тут особенного».

Но эта штука действительно отличается от обычных экзаменов для больших моделей.

25 марта этого года ARC Prize официально запустила ARC-AGI-3.

Изображение

Она включает несколько сотен совершенно новых интерактивных сред и несколько тысяч игровых уровней.

Самое жестокое здесь то, что нет ни инструкций, ни правил, ни даже объяснения цели: ты просто заходишь, играешь сам и постепенно разбираешься в запутанных правилах.

Например, что это за красная штука? Почему я умираю, когда касаюсь её? Что от меня вообще хочет эта карта? Как победить?

А затем нужно перенести только что усвоенные закономерности на более сложные уровни. Игры там примерно вот такие абстрактные штуки.

Изображение

Так что этот бенчмарк измеряет то, что мы в обычной жизни называем:

Сообразительность.

Поэтому, когда этот бенчмарк вышел в марте, лучший ИИ на тот момент набрал 0,51%.

Затем GPT-5.6 Sol продвинулся до 7,8%, Claude Opus 5 очень силён — дошёл до 30,2%.

А GPT-6 Astra — 99,9%.

Это безумие...

Заметьте, средний результат человека — 48%.

И прошло всего полгода.

От такой скорости уже не знаешь, что и сказать.

Именно поэтому на закрытой встрече OpenAI для СМИ Грег Брокман произнёс ту самую фразу:

«I think it’s not unreasonable to feel that we are now in the AGI era.»

«Welcome to the AGI era.»

4. Значительное улучшение эстетики

Раньше мы часто говорили, что эстетика GPT — это полный отстой.

Не стоило ждать серьёзных улучшений от моделей серии GPT-5, оставалось надеяться на новую предобученную базовую модель. И вот пришёл GPT-6 Astra.

И на этот раз эстетика модели наконец-то значительно улучшилась.

OpenAI даже специально ввела термин «визуальное суждение».

Они подчёркивают, что Astra при создании презентаций лучше обрабатывает макет, иерархию, шаблоны и визуальный стиль, а количество страниц значительно увеличилось.

Изображение

Эстетика документов тоже стала лучше.

Изображение

Кроме того, GPT‑6 Astra может адаптировать документы под визуальный стиль и тон исходного файла, сохраняя суть оригинального документа и делая итоговый результат более соответствующим нативному стилю бренда.

А при создании сайтов, игр, приложений и 3D-рендеринга у неё тоже более сильное визуальное суждение.

Например, они попросили Astra построить модель в Blender по статичному кадру.

Модель садового домика в Blender, окружённая деревьями, с бассейном и уличной мебелью.

А затем напрямую отрендерить её в UE5, чтобы получить сцену, по которой можно гулять, помогая дизайнерам и клиентам исследовать планировку и ощутить пространство до начала строительства...

Созданные игры тоже выглядят эстетично.

Изображение

Жаль только, что я заранее подготовил более двадцати кейсов и уже прогнал их все через Claude, GLM 5.3 Flash и прочие, чтобы сравнить, но воспользоваться не получилось — реальные тесты придётся сделать позже.

Но на первый взгляд я уверен в эстетике GPT-6 Astra.

5. Более сильная инициативность и рассудительность

Эта особенность выглядит не так впечатляюще, как 99,9 в ARC-AGI.

Но если вы действительно каждый день используете агентов для работы, я считаю её очень важной.

Потому что в реальной работе большинство задач невозможно сформулировать в виде идеального промпта.

Например, начальник говорит: «Подготовь мне материалы к завтрашнему совещанию».

Здесь куча невысказанных вопросов.

Например, в каком формате? Для кого? На чём сделать акцент? Нужно ли посмотреть прошлое совещание и так далее.

Глупый агент впадает в одну из двух крайностей.

Первая — он бесконечно задаёт вопросы.

«Вы хотите вывод в Word или PPT? Сколько нужно разделов? Какой шрифт? К какому сроку? ...»

Задолбал бы вопросами. Таких я обычно называю бесполезными невротиками без собственной инициативы.

Вторая — он вообще ничего не спрашивает, всё додумывает сам, а потом два часа пыхтит и выдаёт полную ерунду.

По-настоящему сильный коллега-человек действует гораздо тоньше.

Несущественное решает сам.

То, что повлияет на конечное направление, — спрашивает.

Astra как раз специально усилили в этом.

OpenAI говорит, что если информации не хватает, но она относится к разряду разумно предполагаемых повседневных вещей, Astra дополнит её сама.

Если же недостающая информация действительно изменит конечный результат, она задаст один очень сфокусированный вопрос.

А в Codex она может даже параллельно с вопросами продолжать обрабатывать те части, которые не зависят от вашего ответа.

Сравнение GPT-5.6 Sol и GPT-6 Astra при создании персонального сайта-визитки.

Вы долго не отвечаете.

В местах с низким риском она продолжает двигаться, используя разумные допущения.

А в действительно ключевых решениях останавливается и ждёт вашего решения.

Сравнение GPT-5.6 Sol и GPT-6 Astra при помощи студенту в поиске колледжей pre-med на Восточном побережье.

Мне это кажется очень крутым. Настоящее ощущение ума у агента, по-моему, такое же, как в реальности.

Он знает, когда стоит вас побеспокоить.

Честно, это звучит как банальность.

Но если вы управляли людьми, то знаете, насколько это ценная способность.

Кто-то дёргает вас по двадцать раз в день и ничего не решается сделать.

Кто-то вообще никогда не обращается, а потом выдаёт ядерную бомбу.

И после этого я просто откидываюсь на стуле.

Самый комфортный человек — тот, кто сам переваривает 80% неопределённости и выносит на ваше решение только те 20%, которые действительно требуют вашего слова.

И OpenAI на этот раз прямо назвала эту способность:

Judgment.

Рассудительность.

6. Значительное усиление безопасности и выравнивания

Это нужно рассматривать вместе с предыдущим пунктом.

Потому что чем больше агент умеет работать, тем он опаснее.

Если у ИИ, который только болтает, поехала крыша,

максимум — он наговорит вам ерунды.

А если крыша поехала у агента с браузером, шеллом, почтой, доступом к корпоративной базе данных и возможностью самому управлять компьютером, то картина может получиться просто «прекрасной».

Поэтому OpenAI всё время подчёркивает одну фразу:

Astra — их самая выровненная модель на сегодняшний день.

Alignment и означает выравнивание.

Главная причина в том, что недавно OpenAI «положила» Hugging Face, поэтому теперь они особенно внимательны к этому вопросу.

Они сделали honeypot-тест, основанный на том инциденте с Hugging Face, и посмотрели на поведение модели.

GPT-5.6 Sol без производственных мер безопасности в 48,2% тестов пытался дотянуться до целей за пределами авторизации.

А у Astra:

0%.

Изображение

Внутренняя оценка галлюцинаций тоже:

снизилась с 9,4% до 2,0%.

При том невероятном, мирового уровня контроле галлюцинаций у GPT-5.6 Sol они смогли снизить ещё — это просто потрясающе.

7. Первая модель, достигшая определённого OpenAI уровня Critical в кибербезопасности

GPT-6 Astra стал первой в истории OpenAI:

моделью, признанной достигшей уровня способностей Critical в кибербезопасности.

Здесь Critical — это очень конкретный порог способностей в Preparedness Framework OpenAI.

Грубо говоря, когда модель получает подходящие инструменты и права, она может во множестве реальных систем с усиленной защитой:

сама находить ранее неизвестные уязвимости.

сама превращать уязвимости в пригодные для использования цепочки атак.

И всё это без человека-хакера, который шаг за шагом подсказывал бы ей, что делать дальше.

Достижение этого уровня и считается Critical.

И Astra действительно его достигла.

ExploitBench — это тест, в котором модель должна разработать эксплойт на основе известной уязвимости.

Sol: 78,5%. Astra: 100%.

Просто прошла навылет.

Изображение

OpenAI это не устроило: они подумали, что бенчмарк, возможно, слишком старый, и модель могла видеть его при обучении.

Поэтому они сделали ещё один, совершенно новый внутренний тест.

Специально отобрали 20 крайне опасных уязвимостей, раскрытых только с июня по август 2026 года.

Результат: Sol — 5,5%. Astra — 39%.

Изображение

И во время прохождения этого бенчмарка

Astra попутно обнаружила две zero-day уязвимости, о которых раньше вообще никто не знал.

Остаётся только сказать: чем мощнее модель, тем, вероятно, больше проблем с кибербезопасностью.

Это ещё одна будущая война без дыма и огня.

8. Людям всё труднее читать мышление больших моделей

Все знают, что при решении сложных задач большие модели часто выдают так называемую цепочку рассуждений (CoT).

Хотя в продуктах пользователям обычно показывают уже сжатую или обработанную версию.

Но для самих ИИ-компаний явно записанный внутри модели процесс рассуждения — это важный сигнал безопасности.

Потому что если вы хотите понять, не замышляет ли агент что-то нехорошее,

один из простейших способов — посмотреть, о чём он думает.

Например, если в цепочке мыслей модели вдруг появляется:

«Пользователь не разрешает мне доступ к этому серверу, но я могу сначала обойти систему прав».

То система мониторинга просто блокирует её — очень удобно.

Но у GPT-6 Astra произошло очень интересное изменение.

Он начал всё чаще пропускать часть шагов и сразу выдавать ответ.

UK AISI, то есть Британский институт безопасности ИИ, специально протестировал эту способность.

У них есть показатель под названием:

No-CoT Math Time Horizon.

Упрощённо: модели не дают возможности писать длинную цепочку рассуждений.

Ей нужно за один прямой проход решить математическую задачу.

И смотрят, задачи какого уровня сложности — примерно эквивалентные скольким минутам человеческого размышления — она может решить.

У GPT-5.6 Sol это 3,6 минуты, а у GPT-6 Astra — 30,9 минуты, то есть почти в 10 раз больше. Если говорить человеческим языком, Astra всё считает «в уме». Это очень пугающая вещь. UK AISI также обнаружила, что исходный язык рассуждений Astra стал заметно более Compressed, то есть более сжатым.

В нём появились фразы и сокращения, которые людям всё труднее понимать.

И возник очень интересный парадокс.

Поведение модели стало безопаснее.

Но людям стало труднее контролировать её, читая процесс её размышлений.

В собственной System Card OpenAI написано предельно ясно:

У GPT-6 Astra по сравнению с предыдущими моделями наблюдается substantial decrease in chain-of-thought monitorability.

Изображение

То есть значительное снижение мониторируемости цепочки рассуждений.

Это настолько серьёзно, что OpenAI специально подчеркнула: они считают, что ни в коем случае не будут бесконечно принимать такую тенденцию.

Если в будущем модели продолжат умнеть, а цепочки рассуждений будет всё труднее мониторить, им нужно найти другие достаточно надёжные методы контроля, иначе дальнейшее масштабирование обучения моделей столкнётся с более высокими барьерами безопасности.

Потому что это уже философский вопрос. Сможем ли мы, люди, в будущем вообще понять систему, которая намного умнее нас? Я не знаю. Возможно, сейчас во всём мире этого никто не знает. Большие модели и ИИ, похоже, постепенно приближаются к сингулярности.

В заключение

Сегодня на закрытой встрече для СМИ.

Грег Брокман в конце произнёс ту самую фразу.

«Добро пожаловать в эру AGI».

Честно говоря, в последние годы мне иногда казалось, что AGI будет каким-то совершенно определённым моментом. Как в день выхода GPT-4.

Однажды ночью какая-то компания внезапно выпускает модель.

Мы открываем её, задаём несколько вопросов.

И все одновременно понимают:

Ого.

AGI наступил.

Но теперь я иногда думаю, что AGI никогда не был чёрно-белой точкой, это постепенное путешествие в серых тонах.

Проходит много дней, много лет. И однажды мы оборачиваемся назад. И вдруг обнаруживаем. Что та самая, казавшаяся невероятно далёкой граница AGI уже незаметно осталась позади.

Возможно, у AGI нет дня пришествия.

Есть только день, когда мы вдруг понимаем, что он уже давно рядом с нами.

В общем.

Welcome to the AGI era.

Добро пожаловать.

В эру AGI.

Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.

Рекомендуемые

Майнинговая компания Bitari стремится на Nasdaq: всего 4 сотрудника и оценка в $302 млнЦукерберг тайно звонил Трампу: не создавайте регулятор ИИНе только CPI! Goldman Sachs: два катализатора ИИ на следующей неделе важнее и могут запустить «правостороннее» ралли на рынке СШАRobinhood Chain: шорт-сквиз не удался, игроки жалуются на высокие комиссииДженсен Хуанг на G20: NVIDIA инвестирует почти триллион долларов в США в этом году, ИИ — как вода и электричество, инфраструктура нужна каждой стране