Сервис развивается: тестируем формат, собираем идеи, улучшаем сервис. Есть идеи?

Написать
Войти
Дайджесты новостей
Пиксель-арт командный центр мониторинга данных: автоматизированная система агрегации новостей, фильтрации рассылок и структурирования графа знаний в локальной базе Obsidian

Архитектура персональной исследовательской лаборатории в Codex и Obsidian: автономный мониторинг новостей, рассылок и брендов

Мэтт Вульф и Киран Фланаган представили архитектуру системы AI Research Desk: диффинг XML-карт сайтов без RSS, сбор email-рассылок через выделенный ящик с защитой от отписок, семантическая фильтрация упоминаний бренда и выгрузка пяти ключевых утренних инсайтов в локальную базу знаний Obsidian.

Архитектура персональной исследовательской лаборатории в Codex и Obsidian: автономный мониторинг новостей, рассылок и брендов

Экспоненциальный рост объема технологических новостей и ежедневных релизов привел к кризису традиционных инструментов потребления информации. Ручной просмотр сотен каналов, чтение десятков email-рассылок и настройка стандартных RSS-ридеров отнимают до 15–20 часов в неделю, при этом большая часть входящего потока оказывается повторами, маркетинговым шумом или пересказами одних и тех же пресс-релизов.

Мэтт Вульф, основатель агрегатора Future Tools, и Киран Фланаган в подкасте Marketing Against The Grain представили инженерное решение этой проблемы — открытую архитектуру персональной исследовательской системы (AI Research Desk). Комплекс объединяет возможности рантайма OpenAI Codex, агентных скриптов и локальной базы знаний Obsidian, полностью автоматизируя сбор, фильтрацию и структурирование информации при бюджете всего $25–30 в месяц на облачные API или с возможностью полностью бесплатного локального запуска.

Модуль 1. Мониторинг сайтов без RSS через диффинг карт сайтов

Многие современные технологические порталы, блоги разработчиков и страницы документации не поддерживают RSS или обновляют ленты с задержкой. Система Вульфа решает задачу через механизм периодического сравнения XML-карт сайтов (sitemap diffing):

  1. Периодический опрос: легковесный скрипт по расписанию скачивает sitemap.xml ключевых целевых доменов (OpenAI, Anthropic, Google AI, TechCrunch, The Verge);
  2. Вычисление диффа: модуль сопоставляет текущую структуру ссылок с сохраненным слепком предыдущего прогона, мгновенно выявляя новые URL;
  3. Фильтрация и парсинг: агент загружает только страницы, соответствующие белому списку тем, очищает HTML от служебного мусора и извлекает чистый текст статьи.

Такой подход обеспечивает обнаружение публикаций в течение нескольких минут после их появления на сайте без необходимости сложного краулинга.

Модуль 2. Агрегатор email-рассылок и обход алгоритмов отписки

Подписка на десятки специализированных рассылок быстро засоряет рабочий почтовый ящик, а использование автоправил часто приводит к автоматической отписке: почтовые сервисы фиксируют отсутствие кликов по ссылкам и прекращают доставку.

Архитектура AI Research Desk включает специализированный почтовый контур:

  • Выделенный адрес (Burner Gmail): регистрация отдельного технического ящика исключительно для входящих рассылок;
  • Вебхук-перенаправление (Webhook Redirect): входящие письма через API пересылаются на вебхук локального сервера обработки;
  • Автоматическая верификация активности: фоновый агент в безопасном окружении открывает служебные ссылки в письмах, подтверждая активность подписчика и сохраняя доставку;
  • Суммаризация содержания: языковая модель извлекает из письма только факты, цифры и ссылки на первоисточники, отбрасывая приветствия и рекламу.

Модуль 3. Семантический мониторинг брендов и трендов

Стандартный сервис Google Alerts генерирует массу ложных срабатываний из-за омонимии и неспособности оценивать контекст. Исследовательский стол заменяет ключевой поиск семантической фильтрацией:

  • Модель получает поисковую выдачу по названию компании, продукта или персоны;
  • Анализируется не просто наличие ключевого слова, а тональность, контекст употребления и смысловая значимость публикации;
  • В отчет попадают только содержательные отраслевые упоминания, рецензии или инциденты, а случайные совпадения и спам отсекаются.

Модуль 4. Второй мозг в Obsidian и график утренних инсайтов

Собранная информация не должна накапливаться мертвым грузом в неструктурированных базах. Вся обработанная фактура направляется в локальное хранилище Obsidian (Second Brain):

  • Разделение контуров: входящие материалы попадают в папку inbox/ со статусом черновика, ссылкой на исходный URL и датой захвата;
  • Двукратный регламент инсайтов: каждый день в 7:00 и 14:00 система формирует сжатый отчет из 5 ключевых тезисов, сопоставленных с текущими проектами пользователя;
  • Автоматическая перелинковка: агент расставляет теги и двусторонние связи ([[wikilinks]]), встраивая новую информацию в общий граф знаний.

Модуль 5. Голосовой ввод и захват идей на ходу

Для фиксации собственных мыслей и оперативных находок используется мобильный контур:

  • Пользователь надиктовывает голосовую заметку через Telegram-бота или системный диктофон;
  • Модель распознавания речи транскрибирует аудио, а языковая модель структурирует поток сознания: выделяет гипотезу, задачи и релевантные проекты;
  • Сформированная markdown-заметка автоматически синхронизируется с хранилищем Obsidian.

Экономика системы: облачные API против локального контура

Режим работыИспользуемый стекЕжемесячные затратыТребования к оборудованию
Облачный APIOpenAI Codex / Claude API$25–30 / месЛюбой ПК или минимальный VPS ($5/мес)
Локальный контурOllama / LM Studio (Llama 3 / Granite)$0 (только электричество)Apple Silicon (M-чипы) или GPU от 16 ГБ VRAM

При использовании облачных эндпоинтов основная часть бюджета уходит на первичное сжатие текстов и работу эмбеддингов. Локальное развертывание полностью устраняет затраты на подписки и гарантирует конфиденциальность личных заметок.

Пошаговый план развертывания персональной лаборатории

  1. Клонировать открытый репозиторий: загрузить шаблон автоматизации с GitHub и развернуть локальное окружение.
  2. Настроить конфигурацию источников: указать список целевых сайтов для диффинга sitemap и подключить выделенный ящик для рассылок.
  3. Указать пути к базе Obsidian: связать выходной каталог скрипта с папкой локального хранилища заметок.
  4. Задать ключи доступа или эндпоинт Ollama: прописать переменные окружения в файле .env.
  5. Запустить планировщик задач: настроить регулярное выполнение фоновых скриптов через системный cron или планировщик ОС.

Построение собственного исследовательского стола позволяет автоматизировать рутину мониторинга, избавиться от информационного шума и сохранить фокус на анализе проверенных фактов.