AI GUIDEПартнёрский материал

Opus 5: почему рекорды тестов расходятся с практикой

Почему топовые результаты Opus 5 на бенчмарках расходятся с ощущениями разработчиков и как считать выгоду от модели на своих задачах.

В материале есть партнёрские ссылки. Вы ничего не переплачиваете; редакция может получить вознаграждение.

Anthropic представила Opus 5 как крупный технологический скачок, и на собственных тестах компании цифры это подтверждают. Часть разработчиков в повседневной работе увидела другую картину: многословие, медленные ответы и склонность усложнять простые задачи. Разбираемся, откуда берётся разрыв между рекордом на бенчмарке и ощущением от модели в реальном проекте.

Что показали тесты

На внутреннем бенчмарке Frontier-Bench v0.1 Opus 5 набрала 43,3 балла против 18,9 у Opus 4.8 — результат более чем вдвое выше предшественника и заметно выше ближайшего конкурента. Модель уверенно держится в верхней части публичных рейтингов по программированию.

Сильные стороны подтверждаются и вне тестов: длительные автономные задачи, исследовательская работа, управление компьютером, сложные визуальные проекты. Здесь модель работает долго без вмешательства человека и доводит задачу до конца.

Что увидели в рабочих условиях

Сервис проверки кода CodeRabbit прогнал модель на своей контролируемой выборке с заранее известными дефектами. Opus 5 нашла меньше этих дефектов, чем базовая система компании, и при этом выдала примерно вчетверо больше малозначительных замечаний.

Расход токенов оказался второй проблемой. На одной и той же работе по ревью кода Opus 5 тратила около 60,5 тысячи входных и 9,5 тысячи выходных токенов за вызов против примерно 40,5 тысячи и 5,8 тысячи у GPT-5.6. То есть читает она примерно на 50 процентов больше, а пишет на 65 процентов больше при том же результате.

Тео Браун, разработчик и глава T3 Chat, описал поведение модели так: почти любой комментарий в коде она воспринимает как критическую проблему и предлагает переписать тысячи строк. После дня плотной работы он оценил реальную экономию от перехода на Opus 5 примерно в 20 процентов вместо ожидаемых по прайсу цифр — именно из-за повышенного расхода токенов на задачу.

Откуда берётся разрыв

Бенчмарк и рабочий день устроены по-разному, и это объясняет большую часть расхождения.

  • В тесте задача сформулирована полностью, критерий успеха известен заранее, а контекст ограничен. Модель оптимизируется ровно под это.
  • В работе инструкция обычно неполная, требования меняются по ходу, а от небольшой проблемы ждут небольшого исправления. Модель, склонная к исчерпывающему ответу, здесь проигрывает даже при более высоком интеллекте.
  • Тщательность, которая приносит баллы на длинной автономной задаче, на коротком ревью превращается в шум: четырёхкратный поток мелких замечаний утомляет ревьюера сильнее, чем помогает.

Ни один из этих пунктов не говорит, что модель слабая. Он говорит, что метрика и сценарий использования разошлись.

Почему собственный бенчмарк — слабый аргумент

Frontier-Bench — тест самой Anthropic. Это не делает цифры выдуманными, но означает, что набор задач и критерии оценки выбирала сторона, заинтересованная в результате. Независимая проверка CodeRabbit проводилась на другом наборе задач и дала обратный знак: меньше найденных дефектов при большем потоке замечаний.

Обе цифры верны одновременно. Просто они измеряют разное, и ни одна не отвечает на вопрос, станет ли конкретной команде работать легче.

Что с этим делать

Смотрите на стоимость задачи, а не на цену за миллион токенов. Модель, которая читает на половину больше и пишет на две трети больше, съедает разницу в прайсе — и наоборот, может окупиться, если решает сложную задачу с меньшего числа попыток.

Разделяйте задачи по типу. Длинная автономная работа, исследование, разбор большого репозитория — сценарий, где тщательность оправдана. Рутинное ревью, мелкая правка, короткий рефакторинг — сценарий, где выгоднее модель попроще и подешевле.

Проверяйте на своём коде, а не на чужих графиках. Прогон на десятке типовых задач вашего проекта с подсчётом токенов и времени скажет больше, чем любой публичный рейтинг. Заодно станет видно, сколько замечаний модели вы реально принимаете, а сколько закрываете не глядя.

Сравните модели перед запуском

Тарифы, лимиты и список моделей — на стороне сервиса. Если что-то разойдётся с описанным здесь, напишите: поправим материал и проставим новую дату проверки.

Открыть каталог моделей

«SEO Разум» не продаёт доступ к API и не является поставщиком токенов.

Opus 5 Claude бенчмарки LLM CodeRabbit расход токенов Frontier-Bench выбор модели для кода

Редакция «SEO Разум»

Разбираем SEO и нейросети на практике: проверяем сервисы на своих проектах, сверяем цены и лимиты с первоисточниками и пишем то, что можно применить в тот же день.

📚 Справочник по SEO и ИИ 🔄 Материалы обновляются 🕐 Обновлено: 15 сентября 2026

Читать по теме

Весь раздел →