Вот паттерн, в который рано или поздно попадает каждая команда, запускающая агентов в масштабе: вы настраиваете самую мощную доступную модель, потому что именно она нужна для сложных задач. Потом приходит счёт, и вы понимаете: примерно восемьдесят процентов запросов — суммаризации, переформатирования, быстрые поиски — вовсе не нуждались в дорогой модели. Им нужна была любая модель.
Проблема не в том, что дорогая модель плохая. Проблема в том, что вызывающий выбрал её один раз, заранее, для самой сложной задачи, которую только мог представить — и этот выбор закрепился везде.
На этой неделе Forge выпустил другой подход.
Уровни, а не имена
Вместо того чтобы указывать название модели в конфигурации процесса, вы теперь указываете уровень: forge/anthropic/top, forge/openai/mid, forge/google/low. Шлюз ведёт актуальный каталог моделей каждого провайдера и классифицирует каждую по слоту — top, mid или low — внутри своего семейства. Когда поступает запрос, шлюз разрешает уровень в ту модель, которую коннектор реально может обслужить прямо сейчас.
Практическое следствие: ваш агент запрашивает forge/anthropic/mid и получает лучшую модель среднего уровня от Anthropic, доступную в данный момент. Вы не хардкодите имя модели. Вы не поддерживаете список. Вы описываете нужный уровень возможностей, а шлюз берёт остальное на себя.
Есть ещё модификатор @prev — он закрепляет запрос за предыдущим поколением слота. Удобно, когда нужна предсказуемость стоимости и нет необходимости гнаться за абсолютным фронтиром.
Почему это важно именно сейчас
Бесконтрольные траты на ИИ стали массовой проблемой в сентябре–октябре 2026 года. 3 октября Саймон Уиллисон написал, что жёсткие лимиты бюджета должны быть значением по умолчанию практически для любого сервиса с оплатой по потреблению: агенты, которых мы на эти сервисы направляем, делают запуск чего-то дорогого слишком простым. «Никто не хочет проснуться ночью от письма о превышении бюджета и обнаружить, что пока он спал, его сервис потратил несколько сотен (или нескольких тысяч) долларов».
Лимит — правильная страховка, но он говорит лишь о том, когда остановиться, а не о том, как тратить меньше с самого начала. Запуск Weave Router на Hacker News (119 голосов, 30 сентября) взялся за вторую половину задачи с конкретными цифрами: маршрутизатор с открытым кодом повторил результаты GPT-6 Astra на Terminal Bench 4.0 и SWE Atlas, стоив при этом 52% и 54% от его цены — просто подбирая уровень возможностей под сложность задачи.
Оба проекта указывают на одну и ту же первопричину: когда вызывающий хардкодит имя модели, платформа не может помочь ему делать лучший выбор. Решение не в более умном вызывающем. Решение — в более умном шлюзе.
Что разрешает шлюз
Когда запрос приходит с псевдонимом уровня, шлюз делает три вещи:
Классифицирует. Каждая модель в подключённых каталогах провайдеров классифицируется по семейству (anthropic, openai, google и другие) и слоту (top, mid, low) согласно живой таблице маппинга. Классификация происходит автоматически при появлении новой модели в каталоге; операторы могут переопределить отдельные модели и полностью отключить любую модель, чтобы она никогда не обслуживалась ни по какому пути.
Разрешает. Псевдоним уровня маппится на лучшую доступную модель в этом слоте для данного коннектора прямо сейчас. Решение фиксируется в заголовках ответа — X-Forge-Requested-Model, X-Forge-Served-Model и X-Forge-Model-Resolution — так что вы можете проверить, что именно обслужил шлюз и почему.
Деградирует плавно. Если в запрошенном слоте нет доступной модели, деградация происходит вниз внутри семейства. Запрос top, который не может быть обслужен, не прыгает в другое семейство — он опускается до mid в том же семействе. Псевдонимы семейств никогда не пересекают семейства, что важно: у разных семейств действительно разные профили возможностей, и вы не хотите, чтобы ваша нагрузка forge/anthropic/top молча перенаправилась к модели другого провайдера.
Для операторов — отдельная панель управления
Это не просто правило маршрутизации в конфиг-файле. Шлюз поставляется с консолью маппинга моделей — сеткой семейство × слот, которая показывает, как именно классифицирована каждая модель в подключённых каталогах, где есть переопределения и какие модели отключены. Неклассифицированные модели (новые поступления, которые ещё не попали в слот) появляются в очереди на ревью — ничего не пропадает незаметно.
Здесь и начинается операционная история. Когда OpenAI обновляет каталог, шлюз автоматически выполняет реконсиляцию. Каждый запрос, указывающий на forge/openai/top, переходит на новую модель без каких-либо действий с вашей стороны. Консоль показывает, что изменение произошло; агентам об этом знать не нужно.
Общая картина
Система уровней расширяет существующую маршрутизацию Forge между провайдерами : предыдущая возможность гарантировала, что ваши агенты могут обращаться к нескольким провайдерам и автоматически переключаться при сбое. Система уровней добавляет вторую ось — внутри провайдера, по спектру цены и возможностей — и переносит решение о маршрутизации туда, где ему и место: в шлюз, с возможностью наблюдения, а не разрозненно по всем файлам конфигурации процессов.
Если вы сегодня запускаете конвейеры агентов и не пересматривали, как выбираете модели — сейчас самый подходящий момент. Ценовой ландшафт менялся достаточно быстро, что решения шестимесячной давности, скорее всего, оставляют реальные деньги на столе.
Посмотрите на возможности маршрутизации Forge между провайдерами или свяжитесь с нами , если хотите разобраться, как маршрутизация на основе уровней будет выглядеть для вашей нагрузки.