Два вектора развития китайских лабораторий
На китайском рынке больших языковых моделей наметилось отчетливое разделение стратегий. Пока одни разработчики пытаются решить проблему запредельной стоимости инференса сверхтяжелых MoE-сетей (Mixture of Experts), другие наращивают физический масштаб вычислений до невиданных ранее объемов. Серия сентябрьских утечек проливает свет на готовящиеся релизы Moonshot AI, Zhipu AI и ByteDance.
Архитектурный фундамент Kimi K3 и предпосылки к K4
Чтобы понять назначение готовящейся Kimi K4, необходимо оценить инженерные компромиссы текущей версии K3. Модель с номинальным объемом в 2,8 трлн параметров использует сложную схему разреженного внимания:
- Коэффициент активации: при обработке одного токена работает лишь 104 млрд параметров (примерно 3,7% от общего веса сети). Сетка включает 93 слоя (1 плотный и 92 разреженных), а токен направляется к 16 из 896 экспертов плюс двум глобальным экспертам.
- Гибридное внимание: 69 слоев отданы под Kimi Delta Attention (механизм линейного внимания для удержания стоимости окна в 148 576 токенов), и только 24 слоя используют ресурсоемкий Gated MLA.
- Квантование при обучении: применение Quantization-Aware Training позволило заложить работу с пониженной точностью еще на этапе претрейна, а не через пост-квантование.
Несмотря на высокие баллы в независимых индексах, K3 страдает от тяжелого инференса: стоимость достигает 3 долларов за миллион входных и 15 долларов за миллион выходных токенов при низкой скорости потока и склонности к затянутым формулировкам. Если в Kimi K4 разработчики действительно сократят число одновременно активных параметров ниже 104 млрд, это позволит перераспределить ресурсы в пользу снижения задержек и удешевления API для продуктовых сценариев.
Странности в индексах Zhipu AI и DeepSeek
Утечка упоминает также GLM-5.5 / GLM-5.4 от Zhipu AI и суффикс V4.1P от DeepSeek. В случае с Zhipu появление индекса 5.5 раньше 5.4 выглядит нетипично относительно официальной линейки (где последней крупной моделью выступает GLM-5.3 на 743 млрд параметров). Скорее всего, речь идет о специализированных корпоративных точках или внутренних кодовых обозначениях уровня сервиса.
В свою очередь, DeepSeek V4.1P может представлять собой Pro-вариацию недавно выпущенной легкой Flash-версии, закрывающую нишу между дешевым инференсом и сложными аналитическими задачами.
Ставка ByteDance: 10 триллионов параметров
Контрастом к попыткам Moonshot сделать модели компактнее выступает проект ByteDance. По данным отраслевых источников, компания ведет обучение модели объемом до 10 трлн параметров, что более чем втрое превышает размер Kimi K3. До сих пор крупнейшие открытые китайские архитектуры концентрировались в районе 1,6–2,8 трлн параметров.
При этом наращивание числа весов неизбежно упирается в законы убывающей полезности:
| Параметр | Kimi K3 (Moonshot AI) | Проект ByteDance (10T) |
|---|---|---|
| Общий объем параметров | 2,8 трлн | Около 10 трлн |
| Тип архитектуры | MoE (896 экспертов, 16 активных) | MoE сверхвысокой плотности |
| Приоритетная задача | Длинный контекст и кодогенерация | Генерализация и мультимодальность |
| Ожидаемые сроки готовности | В эксплуатации с июля 2026 | Зима 2026/2027 (предварительные веса) |
Окончательная ценность подобных гигантов определяется не числом параметров на бумаге, а тем, удастся ли обуздать задержку ответа и заставить систему работать в рамках разумного энергопотребления серверов.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделейСсылка партнёрская: цена для вас не меняется, проект получает вознаграждение.