Когда бизнесу нужно рассортировать миллион входящих обращений в службу поддержки, пометить тональность клиентских отзывов или отфильтровать спам в комментариях, инженеры часто по привычке подключают большие языковые модели (LLM). Но попытка использовать генеративную нейросеть для простой бинарной классификации напоминает вызов бригады профессоров математики для проверки чека в супермаркете.
Генеративная модель тратит вычислительные мощности видеокарт на последовательное порождение текста слово за словом. Вместо быстрого ответа «спам» или «не спам» она начинает формулировать длинные вежливые вступления: «Я внимательно проанализировал ваш текст и пришел к выводу...». Каждое такое слово тарифицируется как выходной токен, который стоит в разы дороже входного. При обработке миллионов строк аналитическая база данных упирается в черепашью скорость (50–80 строк в секунду), а месячный бюджет на облачный API моментально тает.
Стартап TypeSafe AI под руководством Диого Алмейды — бывшего исследователя OpenAI и одного из создателей оригинального ChatGPT — предложил альтернативный подход. Разработанная ими модель Jev отказывается от генерации текста в пользу мгновенной классификации данных за один проход нейросети, сближая мир машинного обучения с производительностью аналитических SQL-запросов.
Неавторегрессионный сдвиг: почему порождать текст больше не нужно
Классические языковые модели являются авторегрессионными. Это означает, что для генерации каждого следующего слова они снова и снова прогоняют весь контекст через миллиарды параметров. Это идеальный механизм для сочинения эссе или написания программного кода, но крайне расточительный для аналитики данных.
Исторически инженеры решали эту проблему с помощью легковесных моделей-энкодеров вроде BERT или RoBERTa. Однако их внедрение требовало колоссальных усилий: собрать вручную размеченный обучающий датасет, настроить сложный пайплайн дообучения (fine-tuning) и постоянно поддерживать выделенную серверную инфраструктуру.
Jev объединяет сильные стороны обоих подходов. Модель понимает естественный язык «из коробки» (zero-shot) без какого-либо дообучения, как современные LLM, но работает по архитектуре неавторегрессионного классификатора. Она принимает текст вместе со списком категорий и за один прямой проход по слоям вычисляет скрытые векторные представления, напрямую формируя вероятности для каждого варианта выбора. На выходе получается не текстовая строка, а строгий типизированный объект с калиброванными числовыми оценками.
Калиброванные вероятности: алгоритм RLCD против ложной сверхуверенности
В разработке потребительских нейросетей стандартным методом тонкой настройки стало обучение с подкреплением на основе предпочтений человека (RLHF и DPO). Эти алгоритмы учат модель говорить складно, авторитетно и убедительно. Однако у такого подхода есть опасный побочный эффект — феномен ложной сверхуверенности (overconfidence bias). Модель может выдать абсолютно ошибочное утверждение с видимой уверенностью в 99%, что делает ее вывод ненадежным для использования в автоматических алгоритмах без участия оператора.
В TypeSafe разработали метод RLCD (Reinforcement Learning for Calibrated Decisions). Его цель — научить нейросеть математически честной калибровке вероятностей (well-calibrated probabilities).
Если Jev оценивает вероятность того, что письмо содержит претензию по возврату денег, в 85%, это означает строгое статистическое соответствие: на большой выборке ровно в 85 случаях из 100 решение окажется верным. Для разработчиков и аналитиков это означает качественный скачок: числовой показатель уверенности становится детерминированной метрикой, на основе которой можно уверенно строить пороговые правила в бизнес-логике.
Экономика принятия решений: парадигма Системы 1 и Системы 2
В фундаментальном труде по поведенческой экономике психолог Даниэль Канеман описал две системы человеческого мышления:
- Система 1: быстрая, бессознательная, автоматическая интуиция, мгновенно распознающая лица и простые образы.
- Система 2: медленное, ресурсоемкое, глубокое аналитическое рассуждение, включающееся при решении сложных задач.
В современной архитектуре программных комплексов Jev берет на себя роль высокоскоростной Системы 1. Модель быстро и дешево обрабатывает 95% входящего потока данных — стандартные вопросы, очевидный спам, типовую маршрутизацию. И только оставшиеся 5% сложных, спорных или пограничных ситуаций (где калиброванная уверенность Jev опускается ниже заданного порога, например 75%) передаются «тяжелым» рассуждающим моделям вроде GPT-5 или Claude Sonnet.
Такое разделение труда кардинально меняет экономику проекта:
- Тариф Jev составляет фиксированные $0.042 за один миллион входных токенов.
- Стоимость выходных решений равна $0.00, поскольку модель не генерирует текст.
- Для сравнения, у популярной легковесной модели Gemini 3.5 Flash Lite миллион входных токенов стоит $0.30, а выходных — $2.50. На масштабах сотен миллионов строк переход на Jev снижает расходы на ИИ в 25–50 раз.
В сравнительном тесте инженеров аналитической платформы MotherDuck на датасете из 100 000 новостных статей Jev выполнил полную классификацию за 40 секунд (со скоростью 2484 строки в секунду) с затратами всего $0.50. Модель gpt-4o-mini решала ту же задачу почти 20 минут, обработав лишь 84 строки в секунду и потратив вчетверо больше средств.
Сквозной сценарий: классификация прямо внутри SQL-запроса
Облачная СУБД MotherDuck интегрировала Jev непосредственно в аналитический диалект SQL в виде встроенной скалярной функции prompt_jev(). Это позволяет классифицировать неструктурированные текстовые колонки прямо во время выборки данных без написания внешних Python-скриптов и очередей сообщений.

В первом примере текст входящих сообщений классифицируется по заранее заданному набору категорий с описанием каждой роли:
-- Интеграция классификации Jev в стандартный SQL-запрос
SELECT
ticket_id,
customer_tier,
prompt_jev(
message_body,
'Определите категорию клиентского обращения и приоритет обработки',
choice := [
{label: 'billing_critical', description: 'Ошибки списания средств и двойные транзакции'},
{label: 'service_outage', description: 'Полный сбой в работе личного кабинета или API'},
{label: 'feature_request', description: 'Пожелания по добавлению нового функционала'},
{label: 'general_faq', description: 'Базовые вопросы по тарифам и инструкциям'}
]
) AS classification_payload
FROM raw_support_tickets
WHERE created_at >= CURRENT_DATE - INTERVAL '1 day';
Функция prompt_jev() возвращает строго типизированную структуру, которую база данных мгновенно разбирает на отдельные поля:
/* Пример структуры результата prompt_jev() в колонке classification_payload */
{
"decision": "billing_critical",
"confidence": 0.942,
"alternatives": [
{
"label": "general_faq",
"confidence": 0.041
},
{
"label": "service_outage",
"confidence": 0.012
},
{
"label": "feature_request",
"confidence": 0.005
}
],
"calibration_score": "high",
"tokens_evaluated": 184
}
Полученный JSON позволяет писать привычные SQL-фильтры WHERE classification_payload.decision = 'billing_critical' и моментально строить дашборды без промежуточных ETL-конвейеров.
Архитектурные ограничения и инженерный вердикт
Несмотря на впечатляющую скорость и низкую стоимость, Jev — это узкоспециализированный инструмент. Модель принципиально непригодна для генерации связных ответов, перевода текстов, суммаризации или написания программного кода. Кроме того, Jev является «черным ящиком»: она не умеет объяснять ход своих мыслей словами (chain-of-thought) и возвращает только вероятности. Ее контекстное окно ограничено 64 000 токенов, чего с избытком хватает для писем, логов, стектрейсов и документов, но мало для анализа гигантских монографий.
Модель Jev уже доступна на платформе MotherDuck и через агрегатор OpenRouter, где на нее приходится свыше четверти всего мирового трафика классификаторов. Для команд, работающих с большими массивами текстовых данных, это знак важного архитектурного взросления индустрии: вместо попыток решать любую задачу универсальной тяжелой моделью инженеры возвращаются к специализированным, надежным и экономически оправданным компонентам.
