Большинство современных агентных фреймворков жестко привязаны к удаленным облачным API. Каждое действие автономного помощника — чтение файлов проекта, анализ кода, планирование и запуск тестов — генерирует серию сетевых запросов. Это создает две фундаментальные проблемы: корпоративные требования безопасности запрещают передавать закрытый исходный код на сторонние серверы, а сотни итераций отладки быстро исчерпывают бюджет на токены.
В конце сентября 2026 года Google представила обновление Antigravity SDK, добавив нативную поддержку полностью автономного оффлайн-исполнения агентов. Новая подсистема базируется на легковесном локальном движке LiteRT (развитие архитектуры TensorFlow Lite) и оптимизированном слое LiteRT-LM, позволяющем запускать открытые веса моделей семейства Gemma 4 непосредственно на рабочих станциях разработчиков без подключения к интернету.
Архитектура локального рантайма LiteRT
Движок LiteRT ориентирован на максимальное использование аппаратных возможностей локального компьютера. Веса моделей компилируются в оптимизированный бинарный формат .litertlm, поддерживающий аппаратное ускорение через Vulkan, Metal и DirectML:
- Автономный рабочий контур: агент читает локальные файлы, запускает компиляторы и выполняет терминальные команды в изолированной песочнице без единого внешнего сетевого пакета.
- Квантование весов: поддержка схем квантования INT8 и INT4 позволяет поместить модель в оперативную память современных рабочих станций и ноутбуков с архитектурой Unified Memory.
- Пакетное управление контекстом: специализированное кэширование ключей и значений (KV-cache) снижает задержку между шагами многоэтапного агентного цикла.
Инициализация локального агента в коде
Подключение автономного исполнителя в Antigravity SDK требует настройки конфигурации рантайма с указанием пути к локальным весам и параметров аппаратного ускорения:
from google.antigravity import Agent, LocalRuntime
from google.antigravity.runners import LiteRTAgentConfig
# Базовая конфигурация локального рантайма LiteRT с квантованной моделью Gemma 4
config = LiteRTAgentConfig(
model_path="./models/gemma-4-coder-int8.litertlm",
context_window=8192,
enable_gpu_acceleration=True,
kv_cache_quantization="int8"
)
# Инициализация локальной среды исполнения и создание агента
runtime = LocalRuntime(config=config)
agent = Agent(name="offline-code-assistant", runtime=runtime)
При работе в режиме LocalRuntime агент полностью отключает телеметрию и внешние сетевые интерфейсы. Любая попытка вызвать удаленный сетевой ресурс блокируется на уровне ядра рантайма, что позволяет использовать агента в контурах с повышенными требованиями безопасности (air-gapped окружения).
Гибридный режим и автоматическое устранение багов
Для решения сложных инженерных задач SDK поддерживает прогрессивную гибридную схему (Hybrid orchestration). В этом сценарии первичное высокоуровневое планирование декомпозируется быстрой облачной моделью, а непосредственная реализация, правка кода и прогон тестов делегируются локальному агенту. Если подключение к сети отсутствует вовсе, агент выполняет весь цикл полностью автономно:
# Расширение сценария: подключение локальных инструментов и запуск задачи отладки
agent.register_tool("run_pytest", lambda path: runtime.exec_command(f"pytest {path}"))
# Запуск автономного цикла локализации и устранения ошибки
task_instruction = (
"Запусти тесты в ./tests, локализуй причину сбоя в parser.py, "
"внеси необходимые правки и подтверди исправление повторным прогоном."
)
execution_result = agent.execute_task(instruction=task_instruction)
if execution_result.status == "success":
print("Ошибка успешно устранена оффлайн. Внесенные изменения:", execution_result.diff)
else:
print("Требуется вмешательство инженера:", execution_result.error_details)
Аппаратные требования и компромиссы
Перенос рассуждений модели на локальное оборудование накладывает практические ограничения:
- Требования к видеопамяти: для комфортной работы квантованной версии Gemma 4 с широким окном контекста требуется не менее 16–24 ГБ объединенной памяти или выделенной VRAM.
- Скорость генерации: на встроенных графических процессорах ноутбуков генерация длинных фрагментов кода занимает заметно больше времени, чем обращение к облачным кластерам TPU.
Тем не менее, для задач чувствительной корпоративной разработки, работы в поездках и безопасного тестирования скриптов оффлайн-агенты Antigravity предоставляют разработчикам независимость от сетевой инфраструктуры.
