Прошлой ночью Кремниевая долина пережила битву богов ИИ
PanewslabАвтор: 01 FounderАвтор: Max, 01 Founder
Редактор: Max
Прошлой ночью в Кремниевой долине произошло три важных события.
Google выпустила Gemini 3.8 Flash, Meta выпустила Muse Spark 1.3, а стартап Mostik, о котором раньше никто не говорил, попал в эксклюзивное интервью авторитетного издания WIRED.
Если смотреть только на первые два события, это похоже на очередную обычную ночь гонки за лидерство в ИИ.
Google только что вывела Gemini на первое место в DeepSWE, а через несколько часов Meta опубликовала ещё более высокий результат, и титул мирового лидера продержался всего несколько часов.
К 2026 году к такому все уже почти привыкли.
Выход модели, обновление бенчмарков, несколько часов празднования в X, а затем ожидание, пока следующая компания снова обновит рекорд.
Но если связать эти три события прошлой ночи воедино, я думаю, что по-настоящему важное находится вовсе не в этих таблицах лидеров.
Экономика ИИ претерпевает кардинальные изменения.
В последние годы, обсуждая стоимость ИИ, мы чаще всего смотрели на цену за миллион токенов.
Но с появлением агентов эта система измерения становится всё менее пригодной.
В будущем по-настоящему важным вопросом может быть не «сколько стоит миллион токенов», а сколько стоит исправить баг, сколько стоит завершить исследование, сколько стоит заставить агента непрерывно работать три часа.
А прошлой ночью стоимость инференса одновременно снижалась с нескольких совершенно разных направлений.
Google втискивает возможности уровня frontier во всё более дешёвые модели, Meta позволяет агентам выполнять ту же задачу с меньшим количеством токенов и вызовов инструментов, а Mostik пошёл ещё дальше и начал задаваться вопросом:
Если обе стороны коммуникации — это ИИ, зачем моделям вообще общаться на языке, разработанном для людей?
ЧАСТЬ 01. Gemini вернулась
Сначала посмотрим на Google.
Google выпустила свою новую флагманскую модель Gemini 3.8 Flash, которую официально назвала самой мощной на сегодняшний день моделью для рассуждений и кода.
Это также третье обновление серии Flash за шесть недель — с 3.6 до 3.7, а теперь и до 3.8.
Раньше впечатление от Flash было очень простым: быстрее и дешевле, но по возможностям немного уступает самым сильным моделям.
Google сейчас постепенно меняет это определение.
На этот раз ключевые улучшения 3.8 Flash сосредоточены на долгосрочном кодировании и агентных рабочих процессах.
В тесте DeepSWE v1.1, который измеряет способности ИИ к долгосрочной программной инженерии, модель набрала около 74%.
Главное отличие DeepSWE от традиционных бенчмарков кода в том, что это не алгоритмическая задача, которую бросают модели, а реальное помещение агента в репозиторий кода.
Модель должна понять проблему, искать код, изменять файлы, вызывать инструменты, запускать тесты, а после неудачи продолжать искать причину.
Полная задача может длиться десятки или даже сотни шагов.
В таком тесте Gemini 3.8 Flash на время заняла первое место в мире.
Claude Opus 5 также набирает около 74%, GPT-5.6 Sol — около 73%, а ранее лидировавшая Fable 5 — около 70%.
Если смотреть только на способности, между этими сильнейшими моделями уже нет огромного разрыва.
По-настоящему пугает другая цифра: деньги.
Стартовая цена API Gemini 3.8 Flash осталась на уровне $0,75 за 1 млн входных токенов и $3,75 за 1 млн выходных токенов.
Средняя стоимость выполнения полной задачи в DeepSWE составляет всего $2,36.
Для сравнения, у Claude Opus 5 с теми же ~74% средняя стоимость задачи достигает $11,84; у GPT-5.6 Sol с ~73% — $6,46.
То есть при одинаковом уровне способностей к программной инженерии стоимость выполнения может отличаться в несколько раз.
В эпоху агентов это станет очень важным.
В эпоху чат-ботов разница в несколько центов за ответ практически не ощущалась обычными пользователями.
Но агенты — совсем другое дело: агент-кодер может последовательно выполнить 100 шагов, агент-исследователь может обыскать десятки веб-страниц и прочитать сотни страниц данных, а в будущем корпоративные агенты могут работать непрерывно часами.
Google даже официально упомянула, что при сложных задачах 3.8 Flash будет активнее «работать усерднее», выполняя больше рассуждений и вызовов инструментов.
Google не стала заставлять модель «меньше думать» ради экономии, а наоборот — поскольку токены уже достаточно дёшевы, можно позволить ей выполнять более длинные циклы.
Поэтому я считаю, что по-настоящему важное в 3.8 Flash — не очередное первое место в мире.
А то, что она буквально втискивает возможности, которые раньше были доступны только самым дорогим моделям уровня frontier, в ценовой диапазон Flash.
ЧАСТЬ 02. Через три с половиной часа Meta нанесла ответный удар
Пока команда Google праздновала выпуск Gemini 3.8 Flash, внезапно вернулась Meta.
Meta неожиданно выпустила модель Muse Spark 1.3.
Согласно опубликованным Meta оценкам, Muse Spark 1.3 набрала 75,4% в DeepSWE v1.1.
Этот показатель превышает результаты Gemini 3.8 Flash, Claude Opus 5 и GPT-5.6 Sol.
Ещё более впечатляюще то, что Muse Spark 1.2 набирала в этом тесте лишь около 55%.
Переход с 1.2 на 1.3, минорное обновление версии, дал прирост примерно на 20 процентных пунктов.
Но я думаю, что на этот раз у Meta по-настоящему заслуживают внимания не 75,4%.
Есть ещё две цифры: снижение вызовов инструментов примерно на 20% и снижение потребления токенов примерно на 25%.
Это легко упустить из виду, но на самом деле это очень близко к самому важному вопросу после настоящей коммерциализации агентов.
Чаще всего агент тратит деньги впустую не на нормальное мышление, а на отклонение от курса.
Например, агент-кодер на 20-м шаге неправильно понял требования, продолжил изменять пять файлов, запустил три раунда тестов, обыскал кучу кода и только потом понял, что путь был неверным, и начал всё заново.
Десятки вызовов инструментов и десятки тысяч токенов просто потрачены впустую.
Поэтому если модель может раньше обнаружить неоднозначность задачи, раньше понять, что не справляется, раньше спросить пользователя — это фактически прямое снижение затрат.
Многие усиленные в Muse Spark 1.3 способности относятся именно к этой категории: она может одновременно поддерживать несколько рабочих процессов в длинном треде, активно спрашивать при неоднозначных задачах, активно запрашивать помощь при нерешаемых проблемах, подтверждать необратимые операции и меньше забывать исходные ограничения после многих раундов выполнения длинной задачи.
Meta даже начала подчёркивать осознание моделью границ своих возможностей: знает, что умеет, и знает, чего не умеет.
В эпоху чат-ботов эти способности, возможно, не так привлекательны, как рост бенчмарка на 20 баллов, но в эпоху агентов их можно напрямую конвертировать в деньги.
Каждая предотвращённая ошибка агента — это сама по себе оптимизация инференса.
Если рассматривать Google и Meta вместе, единица измерения конкуренции больших моделей незаметно меняется.
В будущем всех, возможно, будет всё меньше интересовать «сколько стоит миллион токенов» и всё больше — другая цифра:
сколько стоит выполнить реальную задачу от начала до конца.
ЧАСТЬ 03. Mostik — прорыв, меняющий правила игры
Если Google и Meta всё ещё изучают, как выполнять задачи с меньшим количеством более дешёвых токенов, то Mostik начинает затрагивать более фундаментальный вопрос:
почему эти токены вообще должны существовать?
Mostik в переводе с русского означает «мост».
Генеральный директор Саша Малышева — главный разработчик этого метода, а главный научный сотрудник — профессор Женевского университета, лауреат Филдсовской премии 2010 года Станислав Смирнов.
Они пытаются сделать вещь, которая звучит просто, но на самом деле чрезвычайно сложна: позволить двум моделям ИИ общаться друг с другом не через естественный язык.
Сегодня подавляющее большинство мультиагентных систем работают так:
Модель A, получив информацию, сначала генерирует сотни или даже тысячи токенов, излагая свои выводы на естественном языке; затем модель B считывает весь этот текст, заново осмысливает его и строит собственное внутреннее представление, после чего продолжает рассуждение.
Но проблема в том, что внутри больших моделей реальные вычисления происходят вовсе не на китайском или английском, а в виде:
высокоразмерных непрерывных математических представлений.
Это всё равно что два компьютера, которые могут напрямую передавать данные, но компьютер A сначала распечатывает файл на сотнях страниц, а компьютер B затем постранично сканирует его обратно с помощью камеры.
Раньше все пытались снизить стоимость печати, а Mostik хочет просто выбросить принтер.
Они пытаются построить мост между внутренними представлениями разных моделей, чтобы модели напрямую обменивались латентными представлениями, а не сначала генерировали естественный язык.
Один эксперимент, раскрытый авторитетным изданием Кремниевой долины WIRED, очень интересен.
Mostik соединила мостом полноценную GLM-5.2 753B и Qwen 3.5 с 4B параметров, способную работать на мобильных устройствах.
Полученная гибридная система по способностям оказалась между двумя моделями, но стоимость инференса составила лишь 1/20 от стоимости полноценной GLM-5.2.
Конечно, говорить, что Mostik уже решила проблему коммуникации моделей, пока слишком рано.
Латентная коммуникация сама по себе появилась не вчера: за последние годы было немало исследований, пытавшихся обмениваться эмбеддингами, скрытыми состояниями, KV-кэшем и другими внутренними представлениями.
По-настоящему сложно то, что архитектуры, параметры, обучающие данные и внутренние системы координат у разных моделей различаются, и как заставить две модели по-настоящему понимать латентные пространства друг друга — само по себе очень трудная задача.
Смирнов сам признаёт, что в настоящее время даже не хватает зрелого математического языка для описания общих представлений между разными моделями.
Но цифра 1/20 меня очень воодушевляет.
Потому что она заставляет меня серьёзно задуматься о совершенно иной будущей архитектуре ИИ.
ЧАСТЬ 04. В будущем вам понадобится лишь модель на несколько десятых миллиарда параметров
Последние два года, обсуждая ИИ на устройствах, мы всё время изучали, как втиснуть в телефон более крупные модели: 7B, 4B, 3B, 1B — постоянная дистилляция, квантизация, сжатие.
Но если путь Mostik в итоге действительно сработает, я думаю, что будущему телефону, возможно, вообще не понадобится большая модель, «умеющая всё».
На вашем устройстве, возможно, достаточно будет запускать маленькую модель на 0.x млрд параметров или несколько млрд параметров.
Она дёшева, может работать постоянно, отвечает за понимание того, в каком приложении вы сейчас находитесь, что только что делали, в каком состоянии устройство, и обрабатывает подавляющее большинство простых высокочастотных задач.
А при действительно сложных проблемах она через коммуникацию в латентном пространстве обращается к удалённой большой модели.
Но ключевое отличие в том, что ей не нужно, как сегодня, заново отправлять в облако контекст из ста тысяч токенов, чтобы удалённая модель прочитала его с нуля.
Возможно, ей нужно передать лишь сильно сжатое латентное состояние.
Удалённой большой модели после выполнения сложного рассуждения тоже не обязательно генерировать тысячи токенов объяснения на естественном языке для локальной модели — она может напрямую передать обратно новое представление.
Таким образом, локальная маленькая модель отвечает за высокочастотные, дешёвые, непрерывные операции, облачная модель передового уровня — только за редкие, но по-настоящему сложные рассуждения, а между ними — эффективная коммуникация через некий мост.
Если в будущем это действительно удастся, снижение стоимости инференса может оказаться далеко не просто сегодняшним снижением цен на API на 30% или 50%.
Это может изменить сам способ организации вычислений ИИ.
ЧАСТЬ 05. Заключение
Оглядываясь на прошлую ночь, на первый взгляд это три совершенно разные новости.
Google выпустила Gemini 3.8 Flash, втиснув возможности передового уровня в ценовой диапазон Flash;
Meta выпустила Muse Spark 1.3, позволив агентам делать больше с меньшим количеством токенов и вызовов инструментов;
Mostik пошла ещё дальше, начав пытаться сделать так, чтобы часть токенов между моделями вообще не создавалась с самого начала.
Все они на самом деле указывают на одно и то же изменение:
интеллект стремительно дешевеет.
И это снижение цены уже не просто снижение цены за единицу API.
Цены на модели падают, объём вычислений, необходимый для выполнения задач, снижается, а теперь даже способ обмена информацией между моделями начинают пересматривать.
Влияние этого в конечном счёте может оказаться гораздо больше, чем рост бенчмарков на несколько процентных пунктов.
Потому что настоящий взрыв многих технологий происходит не тогда, когда они «впервые становятся работоспособными», а тогда, когда они «наконец становятся достаточно дешёвыми для неограниченного использования».
Сегодня заставить агента потратить десятки долларов на выполнение небольшой задачи обычного человека, возможно, совершенно невыгодно.
Если в будущем это будет стоить несколько центов, многие приложения, которые сегодня никто бы даже не рассматривал, внезапно станут жизнеспособными.
Сегодня мы не можем позволить десяткам агентов круглосуточно работать на одного человека, но если стоимость инференса снизится ещё на один-два порядка, это может стать состоянием по умолчанию.
Сейчас уже семь утра, а мне нужно было лечь спать несколько часов назад.
В итоге после выхода Gemini, через несколько часов Meta догнала, а потом я увидел тот самый эксперимент Mostik с 1/20.
Лёжа в постели, я всё думал об этих событиях: о модели на 0.x млрд параметров в телефоне, об облачной большой модели, о том, что им, возможно, вообще не нужно общаться друг с другом на естественном языке.
Чем больше думал, тем меньше мог уснуть, и в конце концов встал и дописал эту статью.
74% у Gemini, 75,4% у Muse — через несколько дней появятся новые цифры, которые их перекроют.
Но сейчас мне действительно трудно унять это волнение.
Потому что вместо того, кто снова занял первое место в мире, меня всё больше волнует другой вопрос:
насколько дёшевым в итоге может стать такой умный ИИ?
Как только мощный интеллект действительно подешевеет до уровня, когда его можно вызывать по желанию, я думаю, многие ИИ-продукты, которые сегодня кажутся безумными, возможно, только начинаются.
Данный контент предназначен исключительно для информационных и образовательных целей и не является инвестиционным советом, связанным с BTCC. BTCC прилагает все усилия, но не может гарантировать правдивость, точность или оригинальность вышеприведенного контента.