Качественный скачок в масштабировании рассуждений
Лаборатория OpenAI проводит закрытое тестирование внутренней модели следующего поколения, существенно превосходящей возможности флагмана GPT-6 Astra. В аналитическом сообществе система фигурирует под кодовым наименованием Bell. Главная особенность новой архитектуры заключается в резком росте эффективности при использовании вычислительных мощностей на этапе генерации рассуждений (test-time compute).
Если предыдущие поколения трансформеров масштабировались преимущественно за счет наращивания параметров и объема предобучающих данных, то новая внутренняя система демонстрирует качественный отрыв именно в глубине и надежности многоэтапных логических выводов.
Бенчмарк Навье-Стокса: 10 000 агентов и сравнение с Astra
Главным показателем возможностей новой системы стал эксперимент над фундаментальной математической проблемой тысячелетия — исследованием гладкости решений трехмерных уравнений Навье-Стокса, описывающих гидродинамику и движение газов. В исследовательском пайплайне была развернута инфраструктура из приблизительно 10 000 взаимодействующих ИИ-агентов, непрерывно выполнявших вычисления на протяжении 88 часов.
В сравнительных замерах надежности выводов при сопоставимом расходе вычислений:
- GPT-6 Astra: показала вероятность успешного прохождения критических математических доказательств на уровне около 0,1%.
- Новая модель (Bell): при аналогичных вычислительных затратах продемонстрировала показатель около 0,25%, показав более чем двукратное превосходство в эффективности использования выделенных ресурсов.
Это подтверждает: система не просто перебирает больше вариантов, а более избирательно и точно выстраивает дерево поиска решений, отсекая тупиковые гипотезы.
Обучение в реальном времени и протоколы карантина
По официальным данным, обучение этой внутренней архитектуры началось 28 августа и продолжается в настоящее время. С каждым циклом оптимизации результаты на внутренних олимпиадных тестах продолжают расти, а это означает, что обнародованные метрики отражают лишь промежуточное состояние сети.
Рост возможностей сопровождается ужесточением мер предосторожности. Из-за труднопредсказуемости эмерджентных свойств столь мощных сетей OpenAI применяет усиленные протоколы изоляции:
| Уровень контроля | Реализация | Назначение |
|---|---|---|
| Песочница инференса | Полная сетевая изоляция тестовых контуров | Исключение несанкционированного доступа модели к внешней инфраструктуре |
| Мониторинг целей | Непрерывный сквозной аудит скрытых шагов reasoning-цепочек | Предотвращение выбора нежелательных или обманных подцелей агентами |
| Карантинная выдержка | Многонедельный стресс-тестинг перед принятием решения о коммерческом релизе | Проверка границ управляемости модели экспертными группами red team |
ChatGPT Images 2.5: прорыв в консистентности редактирования
Параллельно с языковыми исследованиями OpenAI обновила стек генеративной графики, представив ChatGPT Images 2.5. Исторической проблемой диффузионных систем оставалась потеря композиции: попытка изменить мелкую деталь (например, цвет фона или обувь) приводила к случайной модификации черт лица, одежды и освещения.
В обновленной версии внедрены следующие улучшения:
- Пространственная фиксация: точечное маскирование и изменение строго указанного сектора при стопроцентном сохранении остальной геометрии кадра.
- Многоэтапная последовательность: стабильное удержание одного и того же персонажа и стиля через серию из десятков итеративных правок.
- Лидерство в слепых тестах: в рейтинге Text-to-Image Arena версии модели Sunburst и Flare заняли верхние строчки, потеснив ранее лидировавшие решения Google.
Перспективы развития архитектур рассуждения
Динамика внутренних разработок OpenAI задает ориентиры для всей отрасли. Главный вывод для инженеров и продуктовых команд: конкурентное преимущество окончательно смещается от простого вызова базовых LLM к архитектурам агентной верификации и гибкому управлению бюджетом рассуждений на каждый входящий запрос.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделей«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.