Сервис развивается: тестируем формат, собираем идеи, улучшаем сервис. Есть идеи?

Написать
Войти
Дайджесты новостей
Схема быстрой диффузионной генерации текста

Диффузионный ИИ вместо пожетонной генерации: как устроена ультрабыстрая модель Celeris 1

Альтернатива авторегрессионным моделям: Celeris 1 использует диффузию для параллельного формирования текста, достигая задержки в 157 мс и скорости 1280 слов в секунду. Анализируем компромисс между скоростью и качеством рассуждений, особенности параллельной генерации и роль технологии в агентных системах.

Диффузионный ИИ вместо пожетонной генерации: как устроена ультрабыстрая модель Celeris 1

Развитие многошаговых ИИ-агентов столкнулось с фундаментальным архитектурным ограничением традиционных языковых моделей. В классической авторегрессионной архитектуре каждый новый токен вычисляется строго последовательно: нейросеть анализирует весь предыдущий контекст, вычисляет вероятности для следующего слова, выбирает его и повторяет всю процедуру заново. Пока предыдущий токен не сформирован окончательно, следующий элемент вычислен быть не может.

В однократном диалоговом запросе эта задержка часто остается незаметной для пользователя. Однако в агентных системах один сценарий превращается в длинную цепочку из десятков последовательных операций. Агент должен прочитать задачу, сформировать первичный план, выдать формат JSON для вызова инструмента, прочитать ответ API, проверить полученные структуры данных, откорректировать гипотезу и сформулировать итоговый ответ. Когда каждый элемент этой длинной цепочки генерируется пожетонно, общая задержка системы возрастает до десятков секунд, что критически снижает интерактивность интерфейсов.

Модель Celeris 1 предлагает принципиально иной подход к инференсу текста, перенося методы диффузионного синтеза из сферы обработки изображений в область текстовой генерации. Вместо построения предложения слева направо модель стартует с зашумленного векторного шаблона всей будущей последовательности и параллельно уточняет позиции элементов за несколько итераций очистки.

От шума к смыслу: как работает текстовая диффузия

Чтобы понять фундаментальную разницу между подходами, полезно представить различие между диктовкой текста под запись и созданием эскиза. Авторегрессия работает как последовательный диктант: каждое следующее слово фиксируется намертво, и автор не может вернуться к началу предложения, не начав весь процесс заново. Если ранний токен оказался неоптимальным, вся дальнейшая цепочка вынуждена подстраиваться под эту ошибку.

Диффузионная текстовая модель действует иначе: она создает предварительный смутный черновик всего фрагмента и за несколько параллельных проходов одновременно корректирует лексику, грамматические связи и терминологию в разных частях текста. В идеальных условиях число необходимых итераций очистки от шума оказывается существенно меньше, чем общее количество токенов в итоговом ответе. Это позволяет ослабить прямую зависимость времени генерации от длины формируемого текста.

Диффузионный подход начинает с испорченного представления целой последовательности и постепенно восстанавливает смысл. На каждом шаге модель пересматривает множество позиций одновременно. Преимущество технологии связано именно с параллельностью части этих операций, а не с тем, что вычисления якобы "исчезают". Для читателя это различие наглядно: авторегрессия — это диктовка слово за словом, а диффузия — правка черновика, в котором одновременно редактируют вводные слова, термины и итоговые выводы.

Скорость, точность и бенчмарк MMLU-Pro: заявленные показатели Celeris 1

Разработчики Celeris 1 заявляют о впечатляющих характеристиках инференса: задержка до первого фрагмента составляет всего 157 миллисекунд, а сквозная скорость генерации достигает 1280 слов в секунду, что почти в девять раз превышает показатели традиционных быстрых декодеров (около 144 слов в секунду). В академическом тесте MMLU-Pro модель демонстрирует результат в 76%, приближаясь к показателям флагманских моделей уровня ChatGPT-5 (81%).

Однако к этим показателям стоит относиться с инженерной взвешенностью. В исходном материале не раскрываются детали тестового стенда: конфигурация оборудования, длина входного контекста и итоговой выдачи, температура, набор задач и конкретная методика подсчета слов. Официальная документация API Celeris 1 позиционирует модель прежде всего для коротких, хорошо структурированных ответов. Это подтверждает главную сильную сторону диффузионного подхода — молниеносную выдачу предсказуемых лаконичных структур.

Документация разработчика не подтверждает напрямую ни сравнение с ChatGPT-5, ни цифру в 157 мс на произвольном контексте. Поэтому данные показатели следует воспринимать как заявленные создателями ориентиры для специализированных сценариев, а не как доказанный независимый тест для любых агентных задач.

Двухуровневая архитектура для диалоговых систем

Параллельная диффузионная генерация открывает широкие перспективы для построения гибридных двухуровневых агентных архитектур. В такой системе быстрый диффузионный фронтенд принимает на себя рутинные операции с низким уровнем риска и высокими требованиями к скорости реакции.

К таким задачам относятся:

  • Классификация входящих пользовательских обращений и определений намерений.
  • Извлечение именованных сущностей и параметров в строго валидируемый формат JSON.
  • Быстрый поиск и формирование ответов по утвержденной корпоративной базе знаний.
  • Автоматическая маршрутизация запросов между сервисами и создание кратких аннотаций.

Если же задача требует глубокого многошагового рассуждения, сопоставления противоречивых фактов или построения сложного кода, умный роутер перенаправляет её на глубокую авторегрессионную модель. Такой раздельный подход позволяет сохранить высокую скорость реакции интерфейса на простых операциях без потери качества на сложных аналитических задачах.

Ограничения технологии и практические инженерные риски

Несмотря на высокий потенциал, текстовая диффузия несет в себе специфические инженерные риски. Главная проблема заключается в сложности точного контроля длины ответа, предотвращении цикличных повторов и сохранении строгой глобальной связности на длинных дистанциях. В авторегрессии модель точно "знает", где закончилось предыдущее предложение; в диффузионном процессе раннее искажение структуры на первых итерациях может привести к тому, что модель отполирует абсолютно неверную логическую ветку.

Для практического внедрения подобных систем командам разработки потребуется строить собственные тестовые стенды. Оценивать продуктивность системы необходимо не по пиковой скорости выдачи отдельных слов, а по метрикам p50 и p95 полной задержки агентного цикла, проценту корректно сформированных структур данных и суммарной стоимости выполнения бизнес-сценария.

При сравнении вариантов нельзя смешивать время выдачи первого токена, скорость полной генерации ответа и общее время выполнения задачи агентом. Быстрый генератор текста не сможет компенсировать задержки медленной базы данных или внешнего API. Победителями на рынке станут не те модели, которые показывают рекорды в промо-роликах, а архитектуры, обеспечивающие баланс между скоростью, предсказуемостью и эффективным контролем ошибок.