7 октября 2026 г.
Microsoft Research выпустила Agent Lightning v1.0 для обучения ИИ-агентов в рабочих средах
Agent Lightning v1.0 подключает существующие ИИ-агенты к обучению с подкреплением через совместимый с OpenAI API прокси. Фреймворк содержит около 3500 строк кода и поддерживает запуск агентов в Kubernetes.
Microsoft Research Asia представила Agent Lightning v1.0, открытый фреймворк для обучения ИИ-агентов с подкреплением. Система позволяет сохранить используемую агентом среду, инструменты и логику выполнения, не перенося их внутрь отдельной платформы обучения.
Разработчики называют этот подход Harnessed Agentic RL. Во время обучения работает тот же агентный каркас, который предполагается использовать после развертывания. Это сокращает риск того, что экспериментальная и рабочая версии агента будут вести себя по-разному.
Как Agent Lightning подключается к агенту
Между агентом и языковой моделью размещается совместимый с OpenAI API прокси. Агент продолжает обращаться к модели через привычный интерфейс, а Agent Lightning регистрирует запросы, ответы и необходимые для обучения вероятности токенов.
Фреймворк насчитывает около 3500 строк кода и включает три основных компонента:
| Компонент | Назначение |
|---|---|
| API Gateway | Хранит запуски, события и обращения к модели |
| Rollout Controller | Запускает агентов локально или как задания Kubernetes |
| Customized Trainer | Собирает примеры и обновляет модель на базе verl |
Такое разделение позволяет обучать агентов с собственными протоколами инструментов, управлением контекстом и зависимостями. В качестве примеров подобных сред исследователи называют mini-SWE-agent, OpenHands, OpenCode, Claude Code и Codex.
Асинхронное обучение на общем наборе GPU
В версии 1.0 появился режим Collocated Async RL. Запуски агентов и обновление модели используют один набор графических процессоров. Когда накоплено достаточно результатов, шлюз временно прекращает принимать новые запросы, завершает активные операции и передает данные тренеру.
В экспериментах Microsoft такой режим примерно вдвое сократил полное время обучения по сравнению с синхронным RL. При этом ему потребовалось меньше GPU, чем традиционной асинхронной схеме с раздельными вычислительными пулами.
Результат на SWE-bench Verified
Исследователи проверили полный цикл на SWE-smith, mini-SWE-agent и модели Qwen3.5-9B. Набор для обучения содержал около 6000 примеров. После RL-обучения результат Qwen3.5-9B на SWE-bench Verified вырос с 41,8% до 56,4%, то есть на 14,6 процентного пункта.
Тем, кто планирует использовать Agent Lightning в учебном или исследовательском проекте, стоит отдельно проверить требования к вычислительной среде, конфигурацию Kubernetes, совместимость модельного API и метод расчета награды. Представленные показатели относятся к конкретному экспериментальному конвейеру и не гарантируют такой же прирост для другого агента или набора задач.
