Флагманская модель Claude Opus 5.5 внедрила архитектуру адаптивного рассуждения (Adaptive Thinking), позволяющую инженеру гибко управлять объемом мыслительных ресурсов модели. Вместо бинарного переключателя «включено/выключено» в API появился параметр уровня усилий (effort level), определяющий бюджет скрытых токенов размышления перед генерацией ответа.
Нейт Херк провел детальный сравнительный эксперимент, протестировав Opus 5.5 на всех шести доступных режимах: Low, Medium, High, Extra, Max и специализированном агентном профиле Ultracode. Чтобы поставить модель в по-настоящему жесткие условия, для теста была выбрана комплексная задача: создать с нуля интерактивное трехмерное веб-пространство виртуальной конференции на движке Three.js с видом от третьего лица. В качестве сырых вводных данных модели был предоставлен архив реальной технологической конференции AIS Live объемом 105 ГБ на платформе Frame.io, включающий десятки видеозаписей докладов, презентаций и сессий.
Метрики и поведение модели на разных уровнях
Каждый запуск оценивался по нескольким критериям: визуальная проработка окружения, физика перемещения персонажа, интерактивность (возможность присесть в зале, диалоги с NPC, трансляция видео на экранах сцены), время генерации, итоговый расход токенов и количество автономных циклов самопроверки (verification checks).
Режим Low Effort оказался самым быстрым и доступным по цене ($3.98 за прогон), однако результат продемонстрировал серьезные архитектурные и визуальные огрехи. Сцена страдала от мерцания полигонов, персонажи исчезали при приближении камеры («эффект призраков»), а интерактивные экраны отображали статичные заглушки вместо видеопотоков.
Уровень Medium справился с построением общей геометрии залов и базовой навигацией, но не обеспечил качественного погружения. Этот режим подходит для типовых сценариев извлечения фактов и подготовки отчетов, но пасует перед сложным пространственным программированием.
На уровне High модель сгенерировала стабильную сцену с плавным движением, корректно работающими раздвижными дверями и надежной загрузкой ресурсов. Однако логика взаимодействий осталась базовой: сквозь персонажей можно было проходить, а интерактивные стенды не реагировали на клики.
Точка оптимума: Extra Effort и Ultracode
Безоговорочным победителем теста стал режим Extra Effort. Модель продемонстрировала идеальный баланс вычислительных затрат и качества итогового кода. В виртуальном мире появилась честная физика коллизий (столкновений со стенами и объектами), возможность занять любое свободное место в аудитории, а также рабочие диалоги с виртуальными участниками конференции. При этом суммарная стоимость генерации составила около $25 — вдвое дешевле максимального режима.
Режим Max Effort показал классический эффект убывающей отдачи (diminishing returns). Затратив $50.38 (в 12.9 раз дороже режима Low), модель запустила в 2.3 раза больше циклов внутренней самопроверки, но заметно переусложнила логику кода. В результирующей сцене появились избыточные проверки состояния, снизившие частоту кадров в браузере.
Отдельного внимания заслуживает профиль Ultracode. При стоимости генерации в $18.69 он продемонстрировал качество, сопоставимое с Extra Effort, за счет специализированной оптимизации контекстного окна под задачи написания кода. Суммарный бюджет всего сравнительного эксперимента составил $127.
Эксперимент доказал: выкручивать рассуждения на максимум экономически нецелесообразно. Для подавляющего большинства инженерных задач оптимальной рабочей точкой служит режим High или Extra, тогда как Max Effort лишь кратно увеличивает счет за API без ощутимого прироста в качестве.
