Открытая модель GLM-5.3-Flash от Zhipu AI за последний месяц стала одним из главных ориентиров для тех, кто выбирает бесплатную или дешёвую нейросеть под программирование и агентные задачи. Ниже — что у неё внутри, как она выглядит на фоне флагманов вроде Claude Opus 4.8 и Gemini, сколько стоит доступ через официальный API и какой способ сейчас позволяет получить её бесплатно вместе со второй сильной моделью, DeepSeek V4 Flash.
Архитектура: не дообучение, а модель с нуля
GLM-5.3-Flash — MoE-модель на 320 млрд параметров, из которых на каждый токен активируется около 18 млрд. Это не надстройка над GLM-5.2 и не файнтюн предыдущего поколения: архитектуру и методику обучения переписали заново. Обучающий корпус — 30 триллионов токенов мультимодальных данных.
Ключевое архитектурное изменение — гибридная схема внимания, впервые в линейке GLM: разреженное внимание совмещено с линейным, что снижает стоимость обработки длинного контекста без потери точности. Отдельно заявлена техника многослойных гиперсвязей (MHC), которая должна повышать эффективность масштабирования модели.
Отдельно — про инфраструктуру: модель обучена и работает на китайских ИИ-чипах, а не на GPU Nvidia или AMD. Для рынка, где доступ к топовым видеокартам ограничен экспортными правилами, это само по себе показательно: конкурентоспособную модель уровня Opus можно готовить и без Nvidia.
Результаты на бенчмарках
По паре тестов GLM-5.3-Flash подтягивается к топовым закрытым моделям, по паре — уступает им, но заметно обгоняет предыдущее поколение GLM-5.2 и большинство открытых конкурентов. Основные цифры:
| Тест | GLM-5.3-Flash | Контекст |
|---|---|---|
| Terminal-Bench 2.1 | 84,3 | Opus 4.8 — 85, Terra — 87,4 (обе пока впереди) |
| DeepSWE | 63,4 | обходит Opus 4.8, GLM-5.2 и DeepSeek; Terra и Gemini 3.7 Flash пока впереди |
| AutomationBench v1.0.6 | 48,8 | обходит Opus 4.8, Terra, DeepSeek и GLM-5.2; Gemini пока впереди |
| Humanity's Last Exam (без инструментов) | 55,3 | — |
| GDPval | 1730 | остальные крупные модели в сравнении, включая Gemini и Opus, — ниже 1600 |
По индексу интеллекта Artificial Analysis модель набирает 57 баллов — это уровень Claude Opus 4.8 и выше DeepSeek V4 Pro (53 балла). Для открытой модели с ценой в разы ниже флагманских API это одна из сильнейших позиций на рынке прямо сейчас.
Сколько стоит API
Официальная цена GLM-5.3-Flash — 15 центов за миллион входных токенов и 50 центов за миллион выходных. При запуске у Zhipu действовала промо-скидка в два раза (7,5 и 25 центов соответственно), которая по плану действует до 9 сентября 2026 года — если статья читается раньше этой даты, актуальную цену лучше сверить в личном кабинете провайдера, у которого берёте API. При такой цене модель конкурирует не с DeepSeek V4 Pro или Gemini Flash по чистой стоимости, а по соотношению цена/качество на кодовых и агентных задачах — там она заметно выигрывает у GLM-5.2 того же ценового класса.
Как получить GLM-5.3-Flash и DeepSeek V4 Flash бесплатно
Сейчас обе модели можно использовать без оплаты API через приложение для ИИ-программирования Verdent (аналог Cursor или Windsurf с несколькими параллельными агентами). Лимиты у бесплатного тарифа не жёсткие — расход считается за 5-часовое и недельное окно, и типичному разработчику под обычную дневную нагрузку в них уложиться реально.
Между двумя бесплатными моделями выбор зависит от типа задачи: GLM-5.3-Flash сильнее на фронтенде, визуальных и мультимодальных задачах — модель умеет проверять собственный результат по рендеру интерфейса или 3D-сцены и поправлять код, если видит расхождение. DeepSeek V4 Flash лучше на задачах, где важны рассуждения и агентные цепочки, но хуже держит длинные задачи и в тестах по программированию не обходит даже собственную старшую версию DeepSeek V4 Pro — не говоря уже о GLM Flash.
Кроме двух бесплатных моделей, в Verdent доступны флагманы — Fable 5.1, Opus 5, GPT Sol, Kimi K3 и другие, — но уже платно. Для новых пользователей есть 7-дневный пробный период на 100 кредитов с доступом к этим флагманам, платные тарифы начинаются от 5 долларов в месяц.
Что ещё есть в Verdent помимо моделей
Приложение построено вокруг двух разделов — «Проект» и «Менеджер». В разделе проекта лежат навыки: готовые наборы под продуктивность, дизайн, бэкенд, DevOps и фронтенд, плюс возможность добавить свой. Рядом — больше 580 плагинов: GitHub, Vercel, Slack, Supabase, Stripe, Gmail и другие сервисы подключаются без того, чтобы писать интеграцию руками.
В разделе менеджера можно завести нескольких агентов под разные задачи или импортировать готового, назначить агенту выполнение на конкретные дату и время и подключить каналы — Slack, Telegram и Discord, — чтобы ставить задачи не из самого приложения, а прямо оттуда, где обычно идёт переписка с командой.
В настройках модели отдельно выставляются уровень усилий (низкий, высокий, максимальный) и размер контекстного окна — от 300 тысяч до 1 миллиона токенов. На максимальном уровне усилий первый ответ идёт заметно дольше, так что для простых задач его лучше не включать.
Что делать на практике
- Для кодовых, фронтенд- и мультимодальных задач с ограниченным бюджетом — пробовать GLM-5.3-Flash: по цене входа она бесплатна через Verdent, по прямому API — 15/50 центов за миллион токенов на вход/выход.
- Для задач с упором на рассуждения и агентные цепочки без визуальной проверки результата — сравнить с DeepSeek V4 Flash на той же бесплатной связке, но не рассчитывать на неё в длинных многошаговых задачах.
- Если нужен доступ к топовым закрытым моделям без подписки — использовать пробный период на 100 кредитов, а не сразу оформлять платный тариф.
- Перед тем как переносить рабочие процессы на новую модель, стоит проверить контекстное окно и уровень усилий под конкретную задачу — на максимальных настройках первый ответ может занимать заметно больше времени.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделей«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.