и OpenAI Agents SDK

Forge и OpenAI Agents SDK

В OpenAI Agents SDK тоже есть handoffs и guardrails — поэтому ленивая версия этого сравнения просто неверна. Настоящая разница в другом: там handoff передаёт управление между агентами внутри вашего кода, а в Forge handoff — это результат работы, который оценивает управляющий агент и который коммитится в ваш git-репозиторий.

Словом handoff называют две разные вещи

В SDK handoff — это делегирование: один агент передаёт управление другому вызовом инструмента. В Forge handoff — это законченная работа именованной роли, и отдельный управляющий агент читает её и решает, поедет ли она дальше.

Guardrails проверяют вход, валидатор оценивает работу

Guardrails в SDK выполняют проверки входа и выхода параллельно с исполнением — быстро, дёшево и правильно для безопасности. Они не отвечают на вопрос «достаточно ли хороша эта архитектура, чтобы разработчик на ней строил». За это отвечает управляющий агент.

Трассировка, которую можно посмотреть, — и история, которой вы владеете

SDK даёт встроенную трассировку для отладки потока — в инструментах OpenAI. След прогона Forge — ветка в вашем репозитории: спецификация, бриф и каждая передача коммитами, читается через git log спустя месяцы человеком, которого там не было.

Библиотека, на которой строят, и система, которая работает

SDK — это код, который вы деплоите и эксплуатируете. У Forge уже есть расписания, подтверждения, скоупинг секретов, маршрутизация провайдеров, self-hosted раннеры и агенты на организацию вокруг цикла.

Что такое OpenAI Agents SDK — его собственными словами

OpenAI описывает Agents SDK как способ «build agentic AI apps in a lightweight, easy-to-use package with very few abstractions» и как «a production-ready upgrade of our previous experimentation for agents, Swarm». Заявлен «a very small set of primitives»: Agents«which are LLMs equipped with instructions and tools»; Handoffs«which allow agents to delegate to other agents for specific tasks», названные «A powerful mechanism for coordinating and delegating work across multiple agents»; Guardrails«which enable validation of agent inputs and outputs», выполняемые как проверки входа и безопасности «in parallel with agent execution»; Sessions«a persistent memory layer for maintaining working context within an agent loop»; и встроенная трассировка, «that lets you visualize and debug your agentic flows». Принципы дизайна сформулированы прямо: «Enough features to be worth using, but few enough primitives to make it quick to learn» и «Works great out of the box, but you can customize exactly what happens». SDK Python-first — «Use built-in language features to orchestrate and chain agents, rather than needing to learn new abstractions», — использует «the Responses API by default for OpenAI models» и поддерживает сторонних провайдеров через адаптеры. (Источник: openai.github.io/openai-agents-python .)

Это важно, потому что версия этой страницы, которую можно было бы написать по полугодовалому ресёрчу — «у Forge есть handoffs и guardrails, а у SDK нет», — просто ложь. Есть и то и другое, названо теми же словами.

Разница в том, что эти слова означают в каждой из систем.

Разница одной таблицей

OpenAI Agents SDKForge
Что этоНебольшая Python-библиотека для агентских приложенийРаботающая система, которая ведёт агентские команды
Что такое «handoff»Один агент передаёт управление другому вызовом инструментаЗаконченный результат работы именованной роли, который уходит дальше только после одобрения управляющим агентом
Кто судит о качествеВы: guardrails проверяют вход и выход, остальное решает вызывающий агентОтдельный управляющий агент на каждом ребре: пропустить, вернуть с инструкциями на доработку или эскалировать человеку
Отклонённый шагРешает ваш код, обычно повторный промптНовый коммит; предыдущая попытка остаётся в истории, git diff показывает, что изменилось
СледТрассировка в инструментах OpenAI плюс память сессииВетка в вашем репозитории — спецификация, бриф и каждая передача коммитами, роль указана как Co-authored-by
МоделиResponses API по умолчанию для моделей OpenAI, остальные через адаптерыШлюз маршрутизации по пулу провайдеров с весами приоритета и автоматическим failover, включая self-hosted модели
Расписания, подтверждения, секреты, уведомленияВы их пишете и эксплуатируетеВходят: cron-расписания, подтверждения в Telegram, скоупинг секретов, уведомления
Где выполняетсяТам, где вы развернёте своё приложениеУправляемый SaaS или self-hosted раннеры на вашем железе
ОбластьВсё, что вы напишетеРазработка (самый зрелый архетип), а также ресёрч, контент и операции

В чём Forge устроен иначе

Handoff — это артефакт, а не передача управления. Когда роль разработчика в Forge заканчивает, она производит передачу: структурированные поля плюс рассуждение прозой. Эту передачу читает управляющий агент, единственная задача которого — решить, достаточно ли она хороша для следующей роли. Слабая работа не уезжает по цепочке, чтобы тихо стать чужой проблемой. Делегирование двигает работу; проверка — это то, что не даёт двигаться плохой работе. Подробнее: Multi-Agent Pipeline .

Guardrails и валидатор отвечают на разные вопросы. «Безопасен ли этот вход» и «достаточно ли хорош этот дизайн, чтобы на нём строить» — не одна и та же проверка, и дешёвая из них только первая. Управляющий агент — это вызов модели, у которой перед глазами вся передача, и ему разрешено сказать «пока нет, вот чего не хватает» или «на это должен посмотреть человек».

След остаётся в вашем репозитории. Каждый прогон получает ветку со спецификацией, исходным брифом и передачей каждой роли в виде коммитов, где автором записана роль. Трассировка нужна, чтобы отладить поток, пока вы его пишете; ветка нужна, чтобы коллега через два квартала прочитал, почему архитектура пошла именно так, и сравнил вторую попытку с первой. Подробнее: Git-Backed Audit .

Вы описываете команду, а не собираете её. На входе фраза на обычном языке; Forge предлагает роли, переходы и валидатора и ждёт одобрения, прежде чем что-то потратить. Подробнее: Workflow Engine .

Окружающая система уже существует. Расписания, подтверждения и запуск через Telegram , скоупинг секретов и контроль egress , уведомления , self-hosted раннеры и маршрутизация провайдеров с failover. Ничто из этого не трудно написать один раз; всё это утомительно эксплуатировать всегда.

Число, которое один агент показать не может

Guardrails показывают, как часто вход или выход были заблокированы. Это другой вопрос по сравнению с тем, как часто законченную работу признавали недостаточно хорошей, чтобы пропустить дальше, — а именно второй вопрос решает, уедет ли проект не туда.

Двенадцать недель, за которые Forge собирал Forge
Запущено прогонов322
Передач оценено управляющим агентом1216
Возвращено автору на доработку56
Эскалировано человеку24
Прогонов, где руководитель остановил хотя бы одну передачу51
Прогонов завершилось успешно215
Прогонов упало, эскалировано или отменено103
Медианное время от запуска до конца прогона39 минут
Медианное число передач на успешный прогон5
Влитых pull request в 7 репозиториях202

Откуда это взято. Один процесс — Main Forge SDLC, тот самый, который собирает Forge, — все его прогоны за двенадцать недель подряд, посчитанные по собственным записям управляющего контура. Не выборка, не пилот и не клиентский кейс, который мы не можем показать.

Forge останавливал собственную работу 80 раз. 56 передач вернулись автору с конкретными инструкциями на доработку, 24 ушли к человеку. Один прогон из шести прервал его собственный руководитель раньше, чем на работу посмотрел человек. Это ровно та проверка, которую инструмент с одним агентом оставляет вам, — здесь она стоит один вызов модели на ребро и посчитана.

За тот же период влито 202 pull request в 7 репозиториях — примерно 17 в неделю, в ту самую платформу, о которой вы читаете, причём каждое слияние делал человек. По всей организации работа, написанная агентами, влилась в 773 случаях из 875 открытых. Forge — не демо, работающее рядом с продуктом; это способ, которым продукт собирается, и это его коммиты.

Успешный прогон занимает примерно 39 минут и 5 передач. Медиана от запуска до завершения — и внутри этих 39 минут лежат проверки, которые не дали 80 результатам работы доехать до следующей роли в том виде, в каком они были написаны.

1216 суждений о законченных результатах работы, 80 из них отрицательные. Guardrail не смог бы дать эту таблицу: он смотрит на входы и выходы с точки зрения безопасности, а здесь спрашивали, достаточно ли хороша архитектура, чтобы разработчик на ней строил.

Попросите провести вас по самим прогонам — ветка, коммиты передач, вердикты, которые вернули работу назад, и те, что ушли к человеку. Любое другое число на этом сайте относится к конкретному прогону и так и подписано: 18 собранных источников, 11 проверенных прямым обращением, 4 подтверждённых перекрёстно и 2 помеченных как непроверяемые — на странице сценария .

Источники

  • openai.github.io/openai-agents-python — примитивы, handoffs, guardrails, сессии, трассировка, принципы дизайна, позиция по провайдерам.
  • Утверждения о Forge на этой странице ведут на соответствующие страницы возможностей , где механика описана подробно.

Уже прототипируете на Agents SDK?

Принесите процесс, под который вы собирались писать оркестрацию. Forge предложит команду и дождётся вашего одобрения, прежде чем что-то потратить.