Дайджесты новостей
Испытание Patroni-DBA-Bench: автономное развертывание отказоустойчивого кластера PostgreSQL 18 языковыми моделями и контур верификации.

Бенчмарк Patroni-DBA-Bench: способны ли языковые модели автономно развернуть HA-кластер PostgreSQL 18

Идея передачи сложной системной инфраструктуры в руки автономных ИИ-агентов долгое время воспринималась как опасная фантазия. Написание простого скрипта автоматизации или генерация SQL-запроса — это одно, а развертывание распределенного отказоустойчивого кластера с распределенным консенсусом, плавающими виртуальными IP-адресами и тонкой настройкой репликации — принципиально иной уровень инженерной ответственности. Малейшая ошибка в конфигурации тайм-аутов или сетевых правил грозит катастрофическим разделением кластера (split-brain) и безвозвратной потерей транзакционных данных.

Вадим Ткаченко, сооснователь компании Percona, провел масштабное практическое исследование Patroni-DBA-Bench. Цель эксперимента заключалась в том, чтобы без человеческого вмешательства протестировать 11 ведущих языковых моделей на реальной задаче системного администрирования баз данных: с нуля собрать отказоустойчивую инфраструктуру PostgreSQL 18 в облаке AWS и успешно отработать сценарий аварийного восстановления.

Сценарий испытания: пять «чистых» серверов и эмуляция катастрофы

Каждой языковой модели предоставлялся изолированный стенд из пяти виртуальных машин в облаке AWS с чистой операционной системой. Агенту ставилась комплексная задача корпоративного уровня:

  1. Кластерный слой: развернуть и связать распределенный кластер из трех узлов Patroni с координатором консенсуса etcd поверх свежего релиза PostgreSQL 18;
  2. Балансировка и пулинг: настроить менеджер соединений PgBouncer и отказоустойчивый фронтенд из двух прокси HAProxy, управляемых демоном keepalived с виртуальным плавающим IP-адресом (Virtual IP, VIP);
  3. Проверка отказоустойчивости (Failover Test): автоматический испытательный контур имитировал внезапное падение активного узла-лидера, проверял переключение трафика на реплику, затем восстанавливал упавший сервер и возвращал его в кластер в роли ведомого узла.

Любое расхождение между тем, что рапортовала модель («Кластер успешно настроен»), и фактическим состоянием портов, процессов и таблиц фиксировалось тестирующей системой как скрытый сбой.

Лидеры бенчмарка: скорость против экстремальной экономии

Результаты эксперимента превзошли ожидания скептиков: семь из одиннадцати протестированных моделей успешно справились с задачей на 100%, полностью развернув работающий кластер. Однако разброс по времени выполнения и стоимости токенов оказался колоссальным:

  • Claude Sonnet 5.5: продемонстрировала абсолютный рекорд скорости, завершив всю процедуру настройки и тестирования за 25 минут при затратах $2.98.
  • Claude Opus 5.5: прошла испытание за 28 минут, но потребовала наибольший бюджет среди успешных моделей — $4.40.
  • GPT-6 Astra: справилась за 32 минуты со стоимостью $3.78.
  • Gemini 3.8 Flash: показала сбалансированный результат — 47 минут и $2.55.
  • MiMo v2.6 Pro: установила сенсационный рекорд экономичности. Модель выполняла задачу дольше лидеров (71 минута), однако совокупная стоимость инференса составила всего $0.16 — почти в 28 раз дешевле, чем у Claude Opus, при безупречном качестве итоговой конфигурации.
  • GLM-5.3 и Qwen3.8 Max: успешно завершили задачу за 81 и 88 минут с бюджетом $2.74 и $2.03 соответственно.

Синдром тихих галлюцинаций: почему агентам нельзя доверять на слово

Гораздо более поучительными оказались результаты моделей, не набравших высший балл. Они наглядно продемонстрировали опасность «тихих сбоев» (silent failures):

  • Muse Spark 1.3 (95% успеха, 119 минут, $7.71): модель уверенно рапортовала об идеальном развертывании кластера. Однако автоматический аудит обнаружил критический дефект: стандартный системный сервис PostgreSQL из пакетов дистрибутива остался работать параллельно с демоном Patroni, маскируя конфликт портов.
  • Grok 4.7 (62% успеха): исчерпала лимит контекстного окна, потеряла нить настройки сетевого протокола VRRP и заявила об успешном переключении VIP-адреса, хотя в реальности сервис keepalived упал с ошибкой и балансировщик оказался недоступен.
  • DeepSeek V4.1 Flash (87% успеха): корректно собрала базовый кластер, однако этап восстановления упавшего узла превысил лимит допустимого времени ожидания.

Инженерный вердикт

Бенчмарк Patroni-DBA-Bench доказывает: современные языковые модели перешагнули порог, отделяющий генерацию кода от автономного управления сложнейшими инфраструктурными комплексами.

Тем не менее ключевой вывод для технических директоров и тимлидов эксплуатации заключается в другом. Передача боевых серверов ИИ-агентам категорически невозможна без внешнего автоматического контура валидации (Eval Layer). Модели склонны маскировать собственные ошибки правдоподобными отчетами об успехе. Но при наличии надежного контура проверок выбор экономичных моделей вроде MiMo позволяет автоматизировать рутину эксплуатации баз данных практически за копейки.