Что такое Devin — его собственными словами
Cognition пишет, что «operates Devin, the first autonomous software engineer», который «plans, writes, tests, and ships production code on its own, working inside your codebase and the tools your team already uses» — заявленная цель в том, чтобы инженеры «operate more like architects: strategizing, designing systems, and focusing on problem solving». Компания утверждает, что Devin «is deployed at some of the largest and most complex institutions in the world». Документация конкретнее и, к её чести, сдержаннее: правило большого пальца — если задача заняла бы у вас три часа или меньше, Devin скорее всего с ней справится, а работу крупнее следует «split into focused sessions», которые могут идти параллельно под управлением. У Devin есть полноценное десктоп-окружение с шеллом, IDE и браузером, поэтому он может запустить ваше приложение, покликать интерфейс и проверить собственные изменения до открытия pull request; поддерживаются сессии по расписанию для повторяющейся работы вроде разбора ошибок Sentry, интеграции MCP, CLI с передачей в облачную сессию и хранилище Knowledge, которое переносится между сессиями. (Источники: cognition.com и docs.devin.ai — When to Use Devin .)
Мы излагаем это полностью, потому что устаревшая версия сравнения — «Devin это демо, он не умеет ни повторяющуюся, ни длинную работу» — неверна. Он планирует сессии, работает параллельно и проверяет себя в настоящем браузере.
Разница — в форме работы и в том, что остаётся, когда сессия закончилась.
Разница одной таблицей
| Devin | Forge | |
|---|---|---|
| Единица работы | Сессия: один автономный инженер на одной ограниченной задаче | Прогон: одна задача проходит через именованные роли, каждая передача оценивается перед пропуском |
| Рекомендуемый размер | Правило самого вендора: примерно три часа человеческой работы или меньше, крупнее — разбивать | Срезы, требующие нескольких точек зрения: продакт, который поднимает неоднозначность, архитектор, разработчик, тестировщик, ревьюер |
| Кто проверяет работу | Devin проверяет свои изменения в браузере, затем PR смотрите вы | Управляющий агент на каждом ребре: пропустить, вернуть с инструкциями на доработку или эскалировать человеку — до того, как начнёт следующая роль |
| Что значит параллельность | Много сессий, каждая доводит свою задачу | Одна задача едет по ролям плюс развёртка в под-прогоны, когда нужен обход |
| Основной артефакт | Pull request | Ветка прогона — спецификация, бриф и передача каждой роли коммитами, роль указана как Co-authored-by, — и затем pull request |
| Память | Knowledge, хранится в Devin | Память агента плюс ветка прогона в вашем собственном репозитории |
| Где выполняется | Инфраструктура Cognition | Управляемый SaaS или self-hosted раннеры на вашем железе |
| Инференс | Модели Cognition | Ваш пул провайдеров с весами приоритета и автоматическим failover, включая self-hosted модели |
| Область | Софт | Разработка (самый зрелый архетип), а также ресёрч, контент и операции |
В чём Forge устроен иначе
Роли, которые спорят, и руководитель над ними. Прогон разработки в Forge — это пять ролей: продакт-менеджер, который поднимает неоднозначность вместо того, чтобы придумать ответ, архитектор, разработчик, тестировщик и ревьюер. Между каждой парой стоит управляющий агент: он читает передачу и решает, пропустить ли её, вернуть с конкретными инструкциями на доработку или отправить человеку. Это механизм для того класса работы, где дорогая ошибка совершается до того, как написана первая строка кода. Подробнее: Multi-Agent Pipeline .
Рассуждение коммитится, а не пересказывается. Каждый прогон получает ветку — forge/workflow/{workflowId}/run/{runId} — со спецификацией, исходным брифом и структурированной и свободной передачей каждой роли отдельными коммитами. Можно прочитать, почему решение принято именно так, сравнить вторую попытку с первой или вмешаться посреди прогона, закоммитив исправленную передачу. Знание, которое живёт в продукте вендора, полезно; история, которая живёт в вашем репозитории, долговечна. Подробнее: Git-Backed Audit
.
Ваше железо и ваши ключи. Self-hosted раннеры оставляют исполнение на ваших машинах, а шлюз маршрутизации отправляет инференс в пул провайдеров, который контролируете вы, — с весами приоритета и автоматическим failover, включая self-hosted модели и любой OpenAI-совместимый эндпоинт. Подробнее: Bring Your Own Hardware и Multi-Provider Routing .
И это не только про софт. Тот же движок, тот же цикл проверки и тот же аудит ведут команду ресёрча, которая проверяет собственные источники, контент-команду или дежурство в операциях. Разработка — то, где Forge зрелее всего, потому что именно так Forge и собирается, — но это один архетип. Смотрите сценарии .
Число, которое один агент показать не может
Один инженер, каким бы хорошим он ни был, не может сообщить, как часто его решение отменяли. Отменять некому. Это не претензия к качеству Devin — это структурный факт про форму работы, и именно его измеряет эта таблица.
| Двенадцать недель, за которые Forge собирал Forge | |
|---|---|
| Запущено прогонов | 322 |
| Передач оценено управляющим агентом | 1216 |
| Возвращено автору на доработку | 56 |
| Эскалировано человеку | 24 |
| Прогонов, где руководитель остановил хотя бы одну передачу | 51 |
| Прогонов завершилось успешно | 215 |
| Прогонов упало, эскалировано или отменено | 103 |
| Медианное время от запуска до конца прогона | 39 минут |
| Медианное число передач на успешный прогон | 5 |
| Влитых pull request в 7 репозиториях | 202 |
Откуда это взято. Один процесс — Main Forge SDLC, тот самый, который собирает Forge, — все его прогоны за двенадцать недель подряд, посчитанные по собственным записям управляющего контура. Не выборка, не пилот и не клиентский кейс, который мы не можем показать.
Forge останавливал собственную работу 80 раз. 56 передач вернулись автору с конкретными инструкциями на доработку, 24 ушли к человеку. Один прогон из шести прервал его собственный руководитель раньше, чем на работу посмотрел человек. Это ровно та проверка, которую инструмент с одним агентом оставляет вам, — здесь она стоит один вызов модели на ребро и посчитана.
За тот же период влито 202 pull request в 7 репозиториях — примерно 17 в неделю, в ту самую платформу, о которой вы читаете, причём каждое слияние делал человек. По всей организации работа, написанная агентами, влилась в 773 случаях из 875 открытых. Forge — не демо, работающее рядом с продуктом; это способ, которым продукт собирается, и это его коммиты.
Успешный прогон занимает примерно 39 минут и 5 передач. Медиана от запуска до завершения — и внутри этих 39 минут лежат проверки, которые не дали 80 результатам работы доехать до следующей роли в том виде, в каком они были написаны.
5 передач и 39 минут — против собственного правила Devin про задачу, которую вы сделали бы за три часа или меньше. Всё, что крупнее этого правила, — ровно та территория, где случились эти 80 остановок и где у одиночной сессии нет никого, кто бы поймал ошибку.
Попросите провести вас по самим прогонам — ветка, коммиты передач, вердикты, которые вернули работу назад, и те, что ушли к человеку. Любое другое число на этом сайте относится к конкретному прогону и так и подписано: 18 собранных источников, 11 проверенных прямым обращением, 4 подтверждённых перекрёстно и 2 помеченных как непроверяемые — на странице сценария .
Источники
- cognition.com — «first autonomous software engineer», заявления об автономности и внедрениях.
- docs.devin.ai — When to Use Devin — правило размера задачи, разбиение и параллельные сессии, сессии по расписанию, десктоп-окружение, Knowledge.
- Утверждения о Forge на этой странице ведут на соответствующие страницы возможностей , где механика описана подробно.