Скрытые испытания под маской бюджетной модели
В LMS Chatbot Arena продолжается практика слепого тестирования неанонсированных моделей через подмену идентификаторов. Под видом стандартной Gemini 3.8 Flash, выпущенной в начале сентября как легковесное решение с показателем 41 балл в Artificial Analysis Intelligence Index, пользователям периодически выдаются ответы существенно более тяжёлой архитектуры. В сообществе разработчиков этот чекпойнт связывают с ранней версией Gemini 4 Pro.
По данным источников, отслеживающих кодовые названия внутренних сборок Google, первая фаза тестирования проходила под обозначением Argon, а текущая получила идентификатор Baryon-B. Это указывает на сохранение внутренней номенклатуры, привязанной к периодической таблице и физическим терминам.
Динамика между первой и второй волной: замеры скорости
Сравнение двух этапов тестирования, разделенных неделей, показало заметное изменение производительности:
- Первая волна (середина сентября): компиляция сложных интерактивных проектов занимала от 5 до 10 минут. Модель справлялась со сложной векторной графикой и статичной 3D-геометрией, но допускала разрывы полигональной сетки и сбои в циклических анимациях. По субъективным оценкам её позиционировали на уровне GPT-6 Astra Max, но ниже Claude Fable 5.1.
- Вторая волна: бенчмарки зафиксировали двукратное падение задержки ответа. Задачи аналогичной сложности теперь выполняются стабильно быстрее 5 минут. Это свидетельствует либо о развертывании оптимизированных TPU-кластеров для инференса, либо о калибровке вычислительного бюджета на этапе рассуждений (reasoning tokens).
Сложные тесты в WebGL и Three.js
Главным полигоном для выявления различий между стандартной Flash и скрытой сборкой стало процедурное написание кода на JavaScript с использованием библиотеки Three.js. Полноценное воспроизведение таких сцен требует расчета пространственной геометрии, шейдеров освещения и физических взаимодействий непосредственно в окне браузера.
В типовых испытаниях обычная модель начального уровня ограничивается примитивами (кубы, сферы) и обрывает скрипт из-за превышения длины контекста. Чекпойнт Baryon-B продемонстрировал запуск с первой попытки в нескольких нетривиальных сценариях:
- Динамическая гидродинамика: генерация модели судна с расчетом деформации водной глади океана и физики качки на волнах в реальном времени.
- Сложная кинематика: интерактивный дирижабль с детализированными гондолами и вращающимися винтами, а также механический цветок со взаимосвязанными передаточными шестернями.
- Физически корректный рендеринг: построение болида Формулы-1 с независимой двухрычажной подвеской для каждого колеса, матовым углепластиковым монококом, текстурой гоночной резины и студийной картой освещения HDR.
Разногласия в оценках и инфраструктурный контекст
Несмотря на демонстрацию сложных шейдеров, мнения тестировщиков разделились. Ряд разработчиков считает, что модель догнала уровень Claude Opus 5.5 за счет точности синтаксиса и скорости компиляции. Скептики же отмечают, что качественного скачка в логическом выводе по сравнению с первой волной не произошло: рост заметен преимущественно в прикладном фронтенд-кодинге, тогда как поведение системы на масштабных репозиториях и в условиях жестких ограничений на галлюцинации пока остается непроверенным.
Параллельное расширение серверного парка Google и испытания специализированных кристаллов для ускорения инференса указывают на подготовку к сокращению удельной стоимости вычислений перед публичным релизом следующего поколения линейки Gemini.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделейСсылка партнёрская: цена для вас не меняется, проект получает вознаграждение.