100 часов стресс-тестов: сравнение GPT-6 Astra и Claude Fable 5.1 в 15 реальных задачах
В производственной среде бизнес оценивает нейросети не по баллам в синтетических бенчмарках, а по качеству законченных артефактов: коду, сверстанным страницам, отчетам и клиентским презентациям. Независимое 100-часовое исследование практика автоматизации Нейта Херка сопоставило две передовые флагманские модели — GPT-6 Astra от OpenAI и Claude Fable 5.1 от Anthropic — в 15 прикладных задачах digital-агентства.
Флагманская модель (frontier model) представляет собой наиболее мощную систему текущего поколения с миллионным контекстным окном и поддержкой автономных инструментов. Итог замера зафиксировал счет 10:5 в пользу GPT-6 Astra. Различие в поведении оказалось фундаментальным: склонность флагмана OpenAI к предварительному диалогу сэкономила 36,3% бюджета на инференс, тогда как флагман Anthropic лидировал в объемных текстах прямого отклика.
Методология и границы эксперимента
Испытания охватывали повседневные сценарии: подготовку презентаций, продающий копирайтинг, аудит P&L, воссоздание сайта с 3D-анимацией, аудит YouTube-канала, программирование и браузерную автоматизацию. Критерием служила практическая полезность результата для работы агентства.
Это прикладной стресс-тест одного специалиста, а не академический замер: автор зафиксировал время и затраты, но не опубликовал полные промпты и число повторов. Позиционирование Astra в официальной документации OpenAI включает контекст в 1 050 000 токенов, до 128 000 выходных токенов, вызовы функций (function calling) и интерпретатор кода по тарифам $10/$50 за миллион токенов. Пользовательские расходы в тесте учитывали цепочки вызовов инструментов, поэтому отличаются от базовых тарифов API.
Поведение в ключевых сценариях
Сопоставление в пяти показательных задачах выявило сильные и слабые стороны систем:
- Консалтинговая презентация (McKinsey-style deck). Fable 5.1 за 37 минут создала 35 слайдов с развитой структурой колонок, плотным текстом и брендингом ($26,00). Astra справилась за 23 минуты ($12,00), уточнив задачу и подготовив лаконичную колоду. Автор отдал победу Fable за глубину автономного отчета, но признал версию Astra удобнее для живого доклада.
- Продающий текст (Sales Letter). В создании посадочной страницы Fable сгенерировала 2 800 слов за 4 минуты ($3,90), детально проработав возражения и блок частых вопросов (FAQ). Astra выдала 1 300 слов за 3 минуты ($1,43), опустив часть барьеров аудитории. Победила Fable как более зрелый черновик.
- Финансовый аудит и P&L. Задача моделировала расчет налогов при pass-through налогообложении — режиме, где прибыль компании отражается напрямую в персональной декларации владельца. Astra задала семь уточняющих вопросов о юрисдикции и расходах, сформировав помесячный отчет и журнал на 3 739 транзакций. Fable выдала обобщенное дерево решений. Astra победила за счет проверяемости (хотя расчет требует валидации бухгалтером).
- Интерактивный веб-дизайн (Perkform). Воссоздание сайта со скролл-динамикой (scroll-driven animation — анимацией при прокрутке экрана) показало разные компромиссы. Fable точнее повторила структуру и пропорции оригинала. Astra обеспечила более плавную анимацию, но текст выпал за границы блоков. Победу за соответствие оригиналу получила Fable.
- Годовой аудит YouTube-канала. Fable выдала 25 страниц текста за 17 минут ($19,00). Astra потратила 42 минуты ($27,00), но подготовила 15 страниц с когортными графиками, удержанием первых 30 секунд и планом на 90 дней. Автор выбрал Astra за форму, готовую к принятию решений.
В остальных десяти задачах (написание кода, зрение, автоматизация браузера) стабильно побеждала Astra за счет меньшего числа ошибок и точности следования системным инструкциям.
Сравнительная таблица опубликованных испытаний
Ниже сопоставлены задачи, по которым автор раскрыл время, расходы и причины выбора победителя:
| Задача | Победитель | Время Fable | Время Astra | Затраты Fable | Затраты Astra | Решающий фактор |
|---|---|---|---|---|---|---|
| Презентация SMB | Claude Fable 5.1 | 37 мин | 23 мин | $26,00 | $12,00 | Полнота аналитического отчета в 35 слайдах |
| Продающий лендинг | Claude Fable 5.1 | 4 мин | 3 мин | $3,90 | $1,43 | Готовый объемный текст (2800 слов) с FAQ |
| Налоги и отчет P&L | GPT-6 Astra | 12 мин | 19 мин | $14,50 | $11,20 | 7 уточняющих вопросов и аудит-лог транзакций |
| 3D-скролл Perkform | Claude Fable 5.1 | 28 мин | 34 мин | $18,20 | $15,40 | Точность структуры исходного референса |
| Аудит YouTube-канала | GPT-6 Astra | 17 мин | 42 мин | $19,00 | $27,00 | Когортные графики и прикладной план |
Экономика инференса и баланс времени
Суммарные метрики 15 задач зафиксировали ощутимый разрыв по времени и бюджету:
- Счет по задачам: GPT-6 Astra — 10 побед; Claude Fable 5.1 — 5 побед.
- Общее время генерации: Claude Fable 5.1 — 9 часов 35 минут 45 секунд; GPT-6 Astra — 11 часов 19 минут 24 секунды (Astra дольше на 1 час 43 минуты).
- Суммарные затраты: Claude Fable 5.1 — $513,36; GPT-6 Astra — $326,98. Экономия при использовании Astra составила $186,38 (36,3%).
Инференс (inference) — процесс генерации ответа обученной нейросетью. Выигрыш Astra в 36% не означает автоматической экономии в любой задаче: в глубоком анализе она может быть дороже ($27 против $19 за аудит канала). Однако в коде и структурировании данных предварительные вопросы позволили Astra избежать ошибочных шагов и дорогих повторных прогонов.
Архитектура поведения: диалог против прямого исполнения
Разница в затратах объясняется двумя противоположными подходами к работе:
- Стратегия предварительного диалога (GPT-6 Astra): Модель останавливается при неполных вводных и задает 3–7 вопросов. Это увеличивает время ожидания, но страхует от фатальных ошибок в коде, базах данных и финансах.
- Стратегия прямого исполнения (Claude Fable 5.1): Модель работает по принципу «one-shot» — генерации по единственной инструкции без встречных вопросов. Она выдает развернутый текст (в 1,5–2 раза длиннее аналога), что ускоряет черновую работу, но повышает риск неверных предположений.
Официальные тесты OpenAI (AutomationBench 41,4%, BenchCAD 95,9%) подтверждают надежность Astra, однако их нельзя смешивать с пользовательским тестом Херка из-за различий в методике.
Матрица маршрутизации: как распределять задачи
На основе зафиксированных компромиссов можно выстроить практическую схему разделения труда:
- Код, базы данных и системные скрипты: Направлять в GPT-6 Astra. Модель аккуратнее управляет зависимостями и реже допускает баги сборки.
- Финансовые расчеты и аналитика: Использовать Astra, отвечая на ее уточняющие вопросы, с последующей проверкой первичных документов экспертом.
- Рекламный копирайтинг и статьи: Поручать Claude Fable 5.1. Модель генерирует богатый и убедительный черновик за один проход.
- Презентации: Выбирать Fable 5.1 для подробных отчетов под рассылку, а Astra — для лаконичных слайдов под живое выступление.
- Браузерная автоматизация: Использовать Astra с изоляцией прав и предварительным тестированием в песочнице.
Ограничения тестирования и открытые вопросы
Тестирование проводилось одним автором на задачах одного агентства без слепой оценки и проверки повторяемости. Расходы в $300–$500 за 15 задач показывают, что интенсивная работа с флагманскими моделями остается заметной статьей бюджета.
Высокая автономность не заменяет контроль человека: аккуратная таблица не заменяет налогового консультанта, а работающий код требует проверки безопасности. Обе модели доказали зрелость для производственных процессов, но наилучший результат дает не отказ от одной системы в пользу другой, а их разделение по функциональным задачам.
