Дайджесты новостей
Высокоскоростное визуальное распознавание дефектов микросхемы моделью Liquid AI D1 Vision за один прямой проход.

Liquid AI D1 Vision: мультимодальное принятие решений без генерации токенов

Когда перед инженерами встает задача проверить качество пайки на конвейере или определить подлинность чека в мобильном приложении, стандартным решением часто становится вызов тяжелой мультимодальной нейросети. Однако этот подход содержит архитектурный изъян: чтобы ответить на простой вопрос «есть ли здесь дефект», авторегрессионная языковая модель вынуждена генерировать текстовые токены рассуждений, тратя секунды драгоценного времени и раздувая расходы на инфраструктуру.

Стартап Liquid AI предложил альтернативу, выпустив семейство моделей d1 и его мультимодальную версию d1 Vision (включающую открытую весовую категорию d1-3b на Hugging Face). Это специализированные модели принятия решений (decision models), которые анализируют изображения и текст за один прямой проход (single forward pass), полностью отказываясь от генерации выходных токенов.

Зачем заставлять нейросеть писать эссе ради одного ответа

В обычных мультимодальных системах каждое изображение кодируется сотнями визуальных токенов, после чего генератор начинает медленно выводить буквы. Liquid AI d1 Vision устроена иначе: на выходе трансформерного блока расположен вероятностный классификатор (probability head). Сеть не сочиняет предложения, а сразу выдает калиброванное распределение вероятностей по заданным гипотезам.

Такой подход дает колоссальный выигрыш в скорости и экономике:

  • Задержка инференса: 8–16 миллисекунд на одном ускорителе против 1500–4000 мс у авторегрессионных мультимодальных LLM;
  • Нулевая стоимость генерации: тарифицируются только входные данные, что делает вызов в 200 раз дешевле;
  • Идеальная стабильность: модель физически не может «забыть закрыть JSON-скобку» или выдать неструктурированную реплику.

В серии тестов из шести прикладных производственных сценариев (отбраковка плат с дефектами пайки, сортировка сканов документов и клиентских тикетов с фото чеков) d1 Vision превзошла флагманскую GPT-6.1 Sol в четырех тестах из шести.

Первичная проверка дефектов через REST API

Для контроля качества на производстве достаточно передать растровое изображение и вопрос в бинарном режиме noul:

import requests

api_url = "https://api.liquid.ai/v1/decisions"
headers = {"Authorization": "Bearer YOUR_LIQUID_API_KEY"}

# Отправка фотографии микросхемы на экспресс-инспекцию
with open("circuit_board.jpg", "rb") as image_file:
    payload = {
        "question": "Is there a short-circuit soldering bridge between the pins?",
        "primitive": "noul",
        "confidence_threshold": 0.90
    }
    response = requests.post(
        api_url,
        headers=headers,
        files={"image": image_file},
        data=payload
    )

result = response.json()
print(f"Дефект обнаружен: {result['decision']}, вероятность: {result['probability']:.3f}, время: {result['latency_ms']} мс")

Категоризация и маршрутизация инцидентов

Если первичный фильтр подтвердил наличие аномалии, второй вызов классифицирует конкретный тип дефекта по списку категорий через примитив choice:

# Уточняющая классификация обнаруженного брака
with open("circuit_board.jpg", "rb") as image_file:
    category_payload = {
        "question": "Identify the primary manufacturing defect type",
        "options": ["solder_bridge", "missing_component", "misaligned_chip", "contamination"],
        "primitive": "choice"
    }
    cat_response = requests.post(
        api_url,
        headers=headers,
        files={"image": image_file},
        data=category_payload
    ).json()

print(f"Классификация брака: {cat_response['result']}")
print(f"Распределение вероятностей: {cat_response['distribution']}")

Ограничения архитектуры и сфера применения

Узкая специализация определяет и границы применимости d1 Vision: она не предназначена для открытого диалога, составления отчетов или творческого редактирования картинок. Список проверяемых вариантов должен быть четким и взаимоисключающим.

Тем не менее для систем компьютерного зрения, систем модерации контента и edge-устройств появление бестокеновых мультимодальных моделей знаменует смену парадигмы. Перенос рутинной классификации на специализированные decision models позволяет сократить аппаратные расходы на два порядка без потери точности.