Claude Opus 5 выдаёт результаты хуже, если включить максимальный режим мышления: на бенчмарке FrontierCode оценки модели падают, как только эффорт поднимают выше уровня «high». Причина проста — модель начинает делать ненужные рефакторинги и лезет чинить код за пределами поставленной задачи. Большинство пользователей на автомате тыкают в max, думая «чем больше думает — тем лучше». Итог обратный: вы платите больше, а получаете код с лишними правками, которые никто не просил. Разберёмся, как выбрать настройки Claude Opus 5, чтобы не сливать бюджет и не терять качество.
Пять уровней и одна ловушка
У Opus 5 пять режимов усилия: low, medium, high, xhigh, max. Логика «выше — точнее» работает не всегда. Сама Anthropic в системной карте прямо предупреждает: на простых задачах модель начинает «переосмысливать» их и теряет фокус — классические diminishing returns. Это не догадка стороннего блогера, а официальное признание разработчика. Так что оптимизация работы ИИ здесь начинается не с промпта, а с правильно выбранного слайдера усилий.
Переобучение ИИ и рост галлюцинаций
Есть и более тревожная цифра. На закрытом бенчмарке AA-Omniscience Opus 5 точнее предыдущей версии Opus 4.8 примерно на 11% — но и ошибается увереннее: частота галлюцинаций выросла примерно на 6%. Получается классическое переобучение ИИ на размышления: чем больше шагов рассуждения, тем больше пространства для того, чтобы модель уверенно выдала неправду. Для фрилансера или предпринимателя, который проверяет факты не построчно, а доверяет выводу целиком, это прямой риск.
Кейс CodeRabbit: больше усилий — не значит лучше ревью
Отдельный тест провёл сервис CodeRabbit, прогнав Opus 5 в режиме xhigh против своей продакшн-модели для код-ревью. Точность по «действенным» комментариям выросла — 39,3% против 35,2%. Но при этом модель нашла меньше реальных известных багов: 55,2% против 61,1%, а количество бесполезных придирок (nitpicks) выросло примерно в четыре раза. Для ИИ для кодирования это критично: разработчик тонет в мелких замечаниях и рискует пропустить настоящую проблему.
Когда низкий эффорт — уже победа
А вот обратный пример. На бенчмарке Zapier AutomationBench Opus 5 даже на самом низком уровне усилия обходит по числу выполненных задач все остальные модели, включая себя же на максималках. То есть для автоматизации рутинных сценариев дешёвый режим — уже потолок, а доплата за max — просто слитые токены.
Как использовать Claude Opus 5 на практике
Готовой карты «где именно падает эффективность Claude Opus 5» пока никто не опубликовал — потолок зависит от вашей задачи и кодовой базы. Поэтому практичный подход такой:
- Начинайте с medium или high, а не с max — особенно для типовых задач по коду и автоматизации.
- Тестируйте оптимизацию промптов отдельно от уровня усилия: часто проблема не в модели, а в размытой формулировке задачи.
- Держите в уме галлюцинации: на xhigh и max перепроверяйте факты, особенно в задачах без доступа к источникам.
- Учтите скрытый нюанс: если классификатор безопасности в Claude.ai, Claude Code или Cowork считает запрос подозрительным, система молча подменяет модель на Opus 4.8 — без предупреждения пользователю.
Вывод простой: эффективность нейросетей в реальной работе определяется не тем, насколько дорогой режим вы включили, а тем, насколько точно он подобран под задачу. Найдите свой потолок экспериментально — и перестаньте переплачивать за худший результат.



Комментарии 0