Первого сентября Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1. По номеру это косметическое обновление, по результатам совсем нет: на научном бенчмарке модель удвоила прошлый результат и обошла более тяжёлую Opus 5, а стоимость типовой работы упала примерно на четверть при неизменных базовых ценах. Разбираем, что стоит за цифрами и как этим пользоваться.
Две модели с одним движком
Claude Fable 5.1 и Mythos 5.1 представляют собой одну и ту же модель. Отличаются они только защитными ограничениями. Fable 5.1 доступна всем и работает на AWS, Google Cloud и Azure. Mythos 5.1 отдана проверенным специалистам по кибербезопасности и наукам о жизни через программы верификации, и пока только организациям из США: у неё сняты часть ограничений, которые мешают исследовательской работе с опасными темами.
Разница в цифрах видна на кодинге. На Terminal-Bench 4.0 Fable 5.1 набирает 55,8%, а её незажатый близнец 60,9%. Пять пунктов, и это цена безопасных настроек.
Что показали тесты
Главный результат Claude Fable 5.1 показала на Terminal-Bench-Science 0.1. Это 70 рабочих сценариев, которые собрали действующие учёные: задачи из наук о жизни, физики, наук о Земле, математики и инженерии, где модель работает шаг за шагом, как исследователь за терминалом.
| Тест | Fable 5 | Fable 5.1 | Соперники |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 24,7% | 52,6% | Opus 5 — 29,0%, GPT-5.6 Sol — 22,4% |
| Terminal-Bench 4.0 (кодинг) | 42,0% | 55,8% | Opus 5 — 52,3%, Mythos 5.1 — 60,9% |
| AutomationBench (бизнес-процессы) | 17,1% | 31,4% | — |
| Humanity's Last Exam, без инструментов | 57,8% | 60,9% | с инструментами 65,0% |
| CursorBench 3.2.0 | 70,5% | 73,4% | — |
Обратите внимание на разброс приростов. Там, где задача требует довести длинную работу до конца, в науке и автоматизации процессов, рост кратный. Там, где нужно ответить на трудный вопрос здесь и сейчас, прибавка скромная: три пункта на Humanity's Last Exam, меньше трёх на CursorBench. Модель поумнела не столько в рассуждении, сколько в выносливости.
Почему стало дешевле
Цены на токены не изменились: 10 долларов за миллион входных, 50 за миллион выходных. Подешевело чтение кэша, теперь это 0,25 доллара за миллион, вчетверо меньше прежнего. Для обычной нагрузки экономия составила около 25%, для агентных сценариев с постоянным перечитыванием контекста доходит до 45%.
Экономия не абстрактная, а прямо связанная с тем, как устроена работа агента. Он гоняет один и тот же большой контекст по кругу десятки раз, и раньше каждое такое обращение стоило заметных денег. Контекст у модели миллион токенов, на выход до 128 тысяч.
Уровни усилия: главный практический рычаг
У модели пять режимов: low, medium, high, xhigh и max. Стоимость растёт вместе с уровнем, и здесь легче всего потерять деньги на пустом месте. Привычка ставить максимум на любую задачу съедает лимиты без всякой отдачи.
Рабочая логика простая. Повседневные вещи вроде разбора документа, черновика письма или правки кода по описанию прекрасно делаются на low и medium. Верхние режимы нужны, когда задача действительно тяжёлая: длинная отладка с неочевидной причиной, исследование с десятком шагов, разбор большого массива данных. Проверьте на своих типовых задачах, где проходит граница. Скорее всего, она сильно ниже, чем вы ставите сейчас.
Работа без присмотра
Anthropic отдельно подчёркивает, что модель спокойнее ведёт себя в долгих задачах без человека рядом: сама ведёт записи о сделанном и переставляет приоритеты, когда обстановка меняется. Это то, на чём ломались предыдущие поколения. Через несколько часов работы агент терял нить и начинал ходить по кругу.
На практике это меняет постановку задачи. Раньше приходилось резать работу на мелкие куски и склеивать результаты вручную. Теперь выгоднее отдать проект целиком, со всем контекстом, и забрать результат вместе с отчётом о проделанном.
Наука как показатель смены класса задач
Два примера, которые Anthropic приводит как демонстрацию, стоят внимания даже если вы далеки от исследований.
Первый про Венеру. Модель обучила небольшую нейросеть на радарных снимках миссии NASA Magellan, собранных больше тридцати лет назад, и построила карту высот примерно для трети планеты. Детализация выросла с 10–20 километров до 2–3, точность высот примерно на четверть. Карту отдают свободно, чтобы будущие миссии могли выбирать точки для посадки.
Второй про белковый дизайн. Модель проектировала белки-связыватели для 12 мишеней и попала примерно в половине случаев, тогда как в этой области нормой считаются 10–15%. По трём мишеням, EGFR, Nipah G и 15-PGDH, сродство получилось вдесятеро выше лучших работ, поданных на конкурсы Adaptyv Bio.
Разница между «ответить на вопрос» и «провести исследование и принести результат» здесь и проходит. Инструмент перестал быть помощником в переписке и стал исполнителем работ, которые раньше требовали недель специалиста.
Кому это нужно, а кому нет
- Разработчикам — да, особенно на отладке. Модель ищет причину сбоя, а не заклеивает симптом.
- Аналитикам и исследователям — да. Длинные документы, таблицы, презентации, многошаговые разборы.
- Тем, кто строит агентов — да, ради выносливости на долгих задачах и подешевевшего кэша.
- Для коротких чатов и мелких вопросов — нет. Здесь хватит модели попроще, и она обойдётся дешевле. Подбирать инструмент под задачу это отдельный навык, который экономит больше, чем любые настройки.
Что делать на практике
- Пересоберите умолчания по уровням усилия. Поставьте low или medium базовым, а высокие режимы включайте осознанно.
- Давайте задачи целиком. Модель выигрывает на объёмных запутанных проектах, а не на цепочке мелких вопросов.
- Просите проверять себя. Требование прогнать написанный код перед сдачей заметно чистит результат и почти ничего не стоит.
- Пользуйтесь тем, что она стала писать проще. Прямая просьба «короче и по-человечески» теперь действительно работает, а не игнорируется.
- Если у вас агентная нагрузка, пересчитайте бюджет. Подешевевшее чтение кэша меняет экономику сценариев, которые раньше не окупались.
Частые вопросы
Чем Claude Fable 5.1 отличается от Mythos 5.1?
Движок один и тот же, отличаются защитные ограничения. Mythos доступна только проверенным специалистам по кибербезопасности и наукам о жизни из организаций США, и на кодинге показывает результат выше на пять пунктов.
Стоит ли переходить с Fable 5?
Если у вас долгие агентные задачи или исследовательская работа, переход окупается сразу: рост на профильных тестах двукратный, а чтение кэша подешевело вчетверо. Для коротких запросов разница почти незаметна.
Какой уровень усилия выбрать по умолчанию?
Начните с medium и поднимайте только на задачах, где результат явно хуже ожидаемого. Максимальный режим оправдан на длинной отладке и многошаговых исследованиях, на остальном он просто быстрее расходует лимиты.
Главный вывод из этого релиза не в конкретных процентах. Прирост случился там, где модель работает долго и сама, а это тот класс задач, который ещё год назад считался ненадёжным по определению.
Сравните модели перед запуском
Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.
Открыть каталог моделей«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.