Заставляем ИИ-агентов проверять гипотезы и запускать бенчмарки с OpenResearch

01 сен 2026
578
46
2
1 неделя

Обычно эксперименты в машинном обучении или алгоритмических задачах идут по кругу. Читаешь свежую статью на arXiv, придумываешь модификацию архитектуры, создаешь новую ветку в гите, запускаешь обучение и ждешь графики. Если идея не сработала, откатываешь изменения и пробуешь заново. Через пару недель в репозитории скапливается десяток брошенных веток, а в голове остается каша из параметров и метрик.

Команда alphaXiv выкатила OpenResearch (утилита orx). Проект пытается автоматизировать этот цикл. Идея в том, чтобы превратить кодинг-агентов вроде Claude Code, Codex или OpenCode в исследователей, которые сами изучают литературу, меняют код в изолированных ветках, проводят тесты и фиксируют артефакты.

OpenResearch Logo

Как это устроено

OpenResearch работает по принципу local-first. Вся база данных SQLite, история запусков, логи и дерево экспериментов живут локально на вашей машине. Исходники написаны на Rust, поэтому CLI работает шустро и не тащит за собой тяжелый рантайм.

Облачный аккаунт разработчики предлагают только для командной работы или аренды их готового пула серверов. Для личных запусков ничего никуда отправлять не нужно.

Реклама

Инструмент решает четыре главные проблемы автоматического ресерча:

  • Параллельные ветки через git worktree. Если дать агенту несколько задач одновременно, проект не превратится в кашу из конфликтов. Каждое направление получает изолированное рабочее дерево.
  • Дерево экспериментов. Каждый прогон жестко связывается с коммитом, дифами, метриками и сгенерированными файлами. Результаты сохраняются в неизменяемом виде.
  • Гибкий выбор инфраструктуры. Один и тот же снапшот кода запускается на локальном процессоре, удаленном сервере через SSH или в кластерах Slurm, Ray, Kubernetes и Modal.
  • Интеграция с научными источниками. Агент умеет искать статьи по ключевым словам и выгружать публикации напрямую по DOI или идентификатору arXiv.

Запуск рабочего пространства

Поставить утилиту на macOS или Linux можно скриптом из терминала:

curl -LsSf https://openresearch.sh/install.sh | sh
orx up

Команда orx up поднимает локальный сервер и открывает веб-дашборд по адресу http://127.0.0.1:4791. Если вы предпочитаете графические интерфейсы без возни с браузером, у проекта есть готовое десктопное приложение.

Когда тяжелые вычисления нужно выполнять на удаленной машине с GPU, воркспейс запускается через SSH:

orx up --remote user@gpu-box

В этом режиме служба слушает локальный интерфейс на удаленном сервере. Открывать порты наружу не придется. Но держите в уме одну деталь: встроенной авторизации на удаленном инстансе нет, так что любой пользователь с доступом к этой машине сможет подключиться к открытому порту.

Подключение агентов

Чтобы используемый агент получил команды для работы с репозиторием, запускаем установку навыков:

orx install-skills

После этого агент начинает понимать контекст исследовательских задач и выполняет специфичные команды:

# Поиск релевантных статей
orx discover keyword "mixture of experts routing"

# Загрузка конкретной публикации
orx paper 2401.12345

# Запуск эксперимента и просмотр логов
orx exp run exp_01h8abc
orx logs run_01h8xyz

В режиме автономного поиска (autoresearch) агент сам формулирует гипотезу, вносит правки в код, запускает прогон, считывает метрики из логов и принимает решение, куда двигаться дальше.

Приватность и телеметрия

Релизные сборки CLI по умолчанию отправляют обезличенную статистику использования с солью из случайного ID установки. Туда не входят пути к файлам, названия репозиториев, токены или содержимое промптов.

Если сбор метрик не нужен, телеметрию легко отключить одной командой:

orx telemetry off

В сборках, скомпилированных напрямую из исходного кода, отправка аналитики отключена изначально.

Ограничения и подводные камни

Проект свежий, в репозитории пока около 600 звезд. Документация в некоторых местах лаконичная, поэтому назначение части параметров приходится разбирать по коду.

Второй момент касается автономных циклов. Если оставить агента без присмотра на ночь, он вполне может потратить весь баланс API токенов, застряв в попытках исправить несовместимость библиотек в тестах. Разумнее сначала проверять связку на коротких итерациях с явными ограничениями по числу шагов.

Кому проект пригодится

OpenResearch стоит попробовать ML-инженерам и исследователям, которые устали вручную вести таблицы с результатами прогонов и переключать ветки в Git. Инструмент дает удобный каркас, объединяющий терминал, запуск на удаленных серверах и навыки чтения статей в единый рабочий процесс.

Исходный код открыт под лицензией MIT, а репозиторий доступен на GitHub: alphaXiv/openresearch-cli.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.