Дайджесты новостей
Новая волна специализированных открытых нейросетей: реферирующая модель AstaBrief, дифференциальное зрение Liquid D1, мультимодальные эмбеддинги Gemma 2, робототехническая Rho-1 и суверенная Kolibri.

Новая волна открытых нейросетей: от компактных реферирующих моделей до не-трансформерного зрения

Эволюция нейросетей с открытыми весами (Open Weights) вступила в фазу зрелой архитектурной диверсификации. Если в предыдущие годы большинство открытых проектов стремились просто повторить архитектуру универсальных трансформеров GPT-3 и GPT-4, соревнуясь лишь в количестве миллиардов параметров, то осенняя волна 2026 года предлагает принципиально иной подход: глубокую оптимизацию под специализированные аппаратные и прикладные задачи.

Разработчикам больше не требуется развертывать колоссальные универсальные монолиты ради узкопрофильных операций. Новое поколение открытых моделей предлагает радикальные инженерные инновации: от непрерывных дифференциальных адаптивных сетей вместо механизма внимания до сквозных моделей для роботизированных манипуляторов и единых мультимодальных пространств эмбеддингов. Рассмотрим пять наиболее ярких представителей этой волны.

AstaBrief 8B

Сверхдлинные контекстные окна в сотни тысяч токенов решили проблему загрузки больших документов, но породили новую сложность: стоимость и задержку повторного чтения гигантских массивов текста. Разработанная институтом AI2 открытая модель AstaBrief 8B сфокусирована исключительно на одной задаче — экстремальном сжатии длинных документов и подготовке фактологически выверенных резюме.

В отличие от универсальных сетей, AstaBrief 8B обучена на специализированных датасетах сжатия информации с жестким штрафом за пропуск сущностей и дат:

  • Модель функционирует в двух режимах: Asta Fast для мгновенного дайджеста новостей и Asta Thinking для глубокого аналитического разбора с генерацией точных постраничных цитат первоисточников.
  • В 4-битном квантовании (AWQ) модель требует всего 6 ГБ видеопамяти, что позволяет запускать ее на любой потребительской видеокарте.
  • В тестах на сохранение критических фактов при компрессии 100-страничных технических отчетов AstaBrief 8B превзошла многие общие модели класса 70B, исключив галлюцинации и смысловые искажения.

Liquid D1 Vision

Самым интригующим архитектурным прорывом стал релиз Liquid D1 Vision от лаборатории Liquid AI. Модель совершила фундаментальный отказ от традиционного механизма внимания (Self-Attention), лежащего в основе архитектуры Transformer, в пользу непрерывных дифференциальных динамических систем (Liquid Foundation Models, LFM).

В стандартных трансформерах вычислительная сложность обработки видеопотока растет квадратично относительно длины последовательности кадров, что делает обработку живого видео крайне ресурсоемкой. Архитектура Liquid обладает линейной вычислительной сложностью:

  • Модель способна в реальном времени анализировать непрерывный видеопоток с камеры наблюдения или экрана пользователя с минимальной задержкой.
  • Параметры нейросети динамически адаптируются к скорости изменения визуальной информации: при статичной картинке потребление вычислительных ресурсов падает почти до нуля, мгновенно возрастая при появлении резкого движения.
  • В мультиагентных конвейерах D1 выступает высокоскоростным визуальным препроцессором: она сжимает сырой видеоряд в компактные семантические токены, которые затем передаются в текстовые LLM.

Embedding Gemma 2

Корпорация Google расширила открытое семейство Gemma специализированной моделью векторных представлений Embedding Gemma 2. Это первая нативная мультимодальная модель эмбеддингов в открытом доступе, проецирующая разнородные типы данных в общее математическое векторное пространство.

В традиционных поисковых системах (RAG) для текста, изображений и аудиозаписей приходилось использовать разные эмбеддинг-модели, что делало невозможным прямой сквозной поиск. Embedding Gemma 2 снимает этот барьер:

  • Пользователь может ввести текстовый поисковый запрос (например: «Схема подключения датчика давления») и напрямую найти релевантную диаграмму в PDF-документе или точный таймкод в архивной записи технического вебинара без предварительной транскрибации.
  • Единая размерность векторов (3072 измерения) существенно упрощает архитектуру векторных баз данных (Qdrant, Milvus, pgvector).

Ниже приведен практический пример извлечения мультимодальных векторов на Python с использованием библиотеки transformers:

import torch
from transformers import AutoModel, AutoProcessor
from PIL import Image

# Инициализация открытой мультимодальной модели эмбеддингов
model_name = "google/embedding-gemma-2"
processor = AutoProcessor.from_pretrained(model_name)
model = AutoModel.from_pretrained(model_name, torch_dtype=torch.bfloat16).to("cuda")

# Подготовка разнородных входных модальностей: текст и изображение
sample_query = "График падения давления в гидросистеме при аварийной остановке"
sample_image = Image.open("technical_schematic_graph.png").convert("RGB")

inputs = processor(
    text=[sample_query],
    images=[sample_image],
    return_tensors="pt",
    padding=True
).to("cuda")

with torch.no_grad():
    outputs = model(**inputs)
    # Извлечение нормализованных векторов признаков
    text_vector = outputs.text_embeds[0]
    image_vector = outputs.image_embeds[0]

# Расчет косинусного сходства между текстом и картинкой напрямую
similarity_score = torch.nn.functional.cosine_similarity(text_vector, image_vector, dim=0)
print(f"Прямое мультимодальное семантическое сходство: {similarity_score.item():.4f}")

Для ускоренного инференса текстовых открытых моделей в продакшене используется высокопроизводительный движок vLLM:

from vllm import LLM, SamplingParams

# Запуск инференса модели с квантованием весов на сервере
sampling_params = SamplingParams(temperature=0.1, max_tokens=1024)
llm_engine = LLM(
    model="allenai/astabrief-8b-instruct",
    quantization="awq",
    gpu_memory_utilization=0.85,
    max_model_len=32768
)

document_text = "Технический отчет о стресс-тестировании серверного кластера..."
prompt = f"<|im_start|>system\nСожми документ до 5 ключевых выводов без потери цифр.<|im_end|>\n<|im_start|>user\n{document_text}<|im_end|>\n<|im_start|>assistant\n"

outputs = llm_engine.generate([prompt], sampling_params)
print(f"Сжатый аналитический отчет:\n{outputs[0].outputs[0].text}")

Rho-1 19B

Специализированная модель Rho-1 19B создана для наведения моста между цифровым интеллектом и физическим миром робототехники. В отличие от стандартных мультимодальных сетей, способных только описывать картинку словами, Rho-1 напрямую генерирует пространственные координаты и траектории движения для манипуляторов.

Обученная на десятках тысяч часов демонстрационных записей физических манипуляций, модель понимает физику окружающего мира: жесткость и деформацию материалов, распределение веса предметов при захвате и пространственные ограничения кинематики манипуляторов. Она способна получать изображение со стереокамеры робота и за 100 миллисекунд рассчитывать последовательность управляющих импульсов для захвата хрупких или нестандартных деталей.

Kolibri 78B

Завершает парад открытых релизов мощная языковая модель Kolibri 78B, созданная европейским консорциумом исследовательских институтов. Модель призвана обеспечить цифровой суверенитет и строгое соответствие европейскому законодательству в области защиты данных (EU AI Act).

При весе в 78 млрд параметров архитектура Kolibri оптимизирована под работу на рабочих станциях:

  • С использованием методов глубокого 4-битного квантования (GPTQ) модель развертывается на системе с двумя видеокартами уровня NVIDIA RTX 4090 (48 ГБ суммарной VRAM).
  • Обучающий корпус включает глубокую балансировку по 24 европейским языкам, демонстрируя высочайшую юридическую и терминологическую грамотность без перекоса в сторону американского английского.

Открытая экосистема наглядно доказывает: будущее за специализированными, эффективными и компактными моделями, решающими конкретные прикладные задачи быстрее и дешевле неповоротливых гигантов.