Задача
«Дай защищаемую картину рынка к четвергу — и мне надо понимать, какие цифры я могу вынести на совет директоров».
Кабинетный ресёрч медленный не потому, что медленно читать. Он медленный потому, что медленно проверять. Собрать двадцать ссылок за день может кто угодно; подтвердить, что каждая действительно подкрепляет ту фразу, к которой приклеена, — вот что съедает неделю. И это ровно та часть, которую выбрасывают под дедлайн.
Здесь же языковые модели наименее надёжны. Модель выдаст строку, похожую на ссылку, с полной уверенностью. Если её никто не откроет, узнают об этом только когда откроет читатель.
Что делает Forge
Два агента с разными задачами, и второй не верит первому на слово.
Исследователь работает с вопросом: ищет, читает отрисованные страницы (а не только сырой HTML), идёт за тем, что выглядит перспективно, отбрасывает остальное.
Аналитик затем самостоятельно заново открывает каждый источник и проверяет, что заявленное утверждение там действительно есть. Три исхода, и все три попадают в отчёт:
- Проверено — аналитик получил страницу и сам подтвердил цитату.
- Подтверждено косвенно — оригинал недоступен (бот-защита, пейволл), но факт подтверждён другим источником, и он назван.
- Не подтверждено — подтвердить не удалось никому. Утверждение остаётся в отчёте с явной пометкой либо убирается.
Третья категория и есть главное. Это разница между инструментом ресёрча и генератором правдоподобного текста.
Доказательство
Реальный прогон по российскому рынку инструментов автоматизации бизнес-процессов, запущенный как живая проверка:
- 18 источников собрано исследователем: информагентства, отраслевая пресса, корпоративные публикации, техномедиа.
- 11 проверено прямой выборкой — аналитик получил страницу и сам сверил цитату.
- 4 заблокированы бот-защитой; каждый факт переподтверждён по названному альтернативному источнику.
- 2 цифры помечены как непроверенные в итоговом документе, а не выданы за факт.
- Результат: PDF на 8 страниц, ссылки кликабельны, кириллица набрана корректно.
Одиннадцать из восемнадцати проверены живым запросом, остальное раскрыто честно. Ни одной выдуманной ссылки в итоге.
Что остаётся под вашим контролем
- Глубина и бюджет. Ресёрч расходует токены; вы задаёте потолок на прогон, и прогон останавливается, а не растёт молча.
- Источники. Открытая сеть, ваши внутренние системы через подключённые инструменты, или и то и другое.
- Гейт перед выдачей. Вердикт аналитика виден до того, как что-то дойдёт до вас — включая вердикт «на этот вопрос хорошо ответить не удалось».
Что под капотом
- Workflow Engine — цепочка из двух ролей и валидатор между ними
- Multi-Provider Routing — какая модель обслуживает какой шаг и сколько это стоит
- Git-Backed Audit — все промежуточные хендоффы сохранены, видно, как получен вывод
- Observability — почему конкретный шаг повёл себя именно так