Дайджесты новостей
Двухскоростная архитектура ИИ-агентов с мгновенной маршрутизацией через быстрые модели решений Jev и Julia 1 в обход тяжелой генерации.

Быстрые модели решений вместо LLM: как Jev и Julia 1 оптимизируют агентные архитектуры

В проектировании автономных агентов долгое время господствовал монолитный подход: для любой операции, будь то сложный рефакторинг кода или проверка категории тикета, вызывалась одна и та же тяжелая модель. В итоге агентные циклы тратили секунды на тривиальные развилки, а разработчики регулярно сталкивались с битыми JSON-ответами.

В сентябре 2026 года в агентной архитектуре оформился новый стандарт — разделение на медленное мышление (System 2) и мгновенные решения (System 1). Специализированные модели не генерируют текст, а выбирают действие из заданного набора за миллисекунды. Два заметных релиза — облачный сервис Jev и открытая модель Julia 1 — наглядно показывают, как быстрый путь решений снижает затраты на API до 80% и ускоряет конвейеры в десятки раз.

Jev

15 сентября 2026 года стартап TypeSafe AI, созданный бывшим исследователем OpenAI Диого Алмейдой, представил модель Jev.

Главная особенность Jev — полный отказ от генерации строк. Модель работает по принципу неавторегрессионного параллельного сэмплирования: входной запрос сопоставляется с заранее заданной строгой схемой типов. На выходе возвращается булево значение, категория или числовая оценка с задержкой 70–500 мс.

Поскольку модель не выводит свободный текст, синтаксические ошибки JSON исключены. Стоимость Jev составляет около $0.04 за миллион входных токенов при бесплатном выводе, что позволяет экономить до 80% бюджета перед вызовом Claude Opus 5.5.

Пример вызова API Jev для классификации входящего инцидента:

import os
import requests

JEV_API_KEY = os.environ["TYPESAFE_JEV_API_KEY"]
headers = {
    "Authorization": f"Bearer {JEV_API_KEY}",
    "Content-Type": "application/json"
}

payload = {
    "context": "Клиент пишет: 'Срочно отмените заказ #98124, деньги списали дважды!'",
    "question": "Определи приоритет и категорию входящего обращения",
    "schema": {
        "priority": ["low", "medium", "high", "critical"],
        "category": ["billing", "cancellation", "technical_bug", "general_inquiry"],
        "requires_human_escalation": "boolean"
    }
}

response = requests.post("https://api.typesafe.ai/v1/decisions", json=payload, headers=headers)
decision = response.json()

print(f"Приоритет: {decision['priority']['value']}")
print(f"Категория: {decision['category']['value']}")
print(f"Уверенность: {decision['priority']['confidence']:.4f}")
print(f"Эскалация человеку: {decision['requires_human_escalation']['value']}")

Julia 1

Если Jev работает в облаке, то релиз Supersonic Labs от 24 сентября 2026 года переносит выбор решений прямо на устройство. Открытая модель Julia 1 на Hugging Face насчитывает 144,3 млн параметров и занимает 550 МБ.

Основанная на компактном энкодере mmBERT-small, Julia 1 оптимизирована под обычные CPU через ONNX Runtime. На чипе Apple M4 модель показывает задержку 33 мс и выполняет до 28 решений в секунду при потреблении менее 400 МБ памяти.

Модель принимает контекст, вопрос и от 2 до 20 вариантов действий, возвращая калиброванные вероятности на 52 языках, что обеспечивает полную приватность локальных данных.

Пример локального запуска Julia 1 через ONNX Runtime:

import numpy as np
import onnxruntime as ort
from transformers import AutoTokenizer

model_id = "supersonic-labs/julia-1"
tokenizer = AutoTokenizer.from_pretrained(model_id)

session_opts = ort.SessionOptions()
session_opts.intra_op_num_threads = 4
session = ort.InferenceSession("julia-1-quantized.onnx", session_opts, providers=["CPUExecutionProvider"])

context = "Пользователь запрашивает экспорт финансового отчета за 3 квартал в CSV."
question = "Какой внутренний инструмент должен вызвать автономный агент?"
candidates = ["export_csv_report", "database_query", "send_email", "trigger_restart"]

inputs = tokenizer(
    [context] * len(candidates),
    [f"{question} [CHOICE] {c}" for c in candidates],
    padding=True,
    truncation=True,
    max_length=256,
    return_tensors="np"
)

onnx_inputs = {"input_ids": inputs["input_ids"], "attention_mask": inputs["attention_mask"]}
logits = session.run(None, onnx_inputs)[0]
probabilities = np.exp(logits) / np.sum(np.exp(logits), axis=-1, keepdims=True)

selected_idx = np.argmax(probabilities[:, 1])
print(f"Выбранный инструмент: {candidates[selected_idx]} (вероятность: {probabilities[selected_idx, 1]:.4f})")

Развитие Jev и Julia 1 завершает эпоху универсальных LLM на все задачи. В современной архитектуре агентов рутинную фильтрацию и маршрутизацию берут на себя модели быстрых решений (System 1), а тяжелые генеративные модели привлекаются только для глубокого анализа и синтеза (System 2). Это устраняет задержки и делает разработку надежных агентов экономически оправданной.