NVIDIA разворачивает гибридную инфраструктуру для ИИ-агентов: прокси Switchyard и модель Nemotron 3.5 Lightning

NVIDIA тихо собирает полноценный стек для автономных ИИ-агентов, связывая проприетарные API с локальными мощностями. Компания открыла исходный код Switchyard — написанного на Rust прокси-сервера для маршрутизации LLM-трафика, а также представила быструю модель Nemotron 3.5 Lightning, заточенную под непрерывную работу.
Суть Switchyard заключается в бесшовной трансляции протоколов. Инструмент на лету конвертирует запросы между форматами OpenAI Chat и Anthropic Messages. Это позволяет подключить условный Claude Code или Codex к открытым моделям через vLLM или Ollama. Агент продолжает общаться через привычный API, но под капотом работает гибкая маршрутизация. Разработчики могут настроить LLM-классификатор, который будет отправлять базовые запросы на локальные нейросети, а сложные задачи эскалировать в платные облачные API.
Для обработки локального трафика в такой связке NVIDIA предлагает Nemotron 3.5 Lightning. Это модель на 30 млрд параметров, из которых при генерации активируются только 3 млрд. Подобная архитектура дает четырехкратный прирост скорости — критически важный показатель для агентов, постоянно выполняющих фоновые задачи. На тестах PinchBench модель показала точность 86%, закрыв 10 000 задач на 35% быстрее сопоставимой Qwen3.6 35B.
Оба релиза бьют в главную проблему современных AI-инструментов разработки — стоимость и задержки при бесконечных обращениях к облаку. Разработчики получают инструменты для сборки гибридных систем, где рутинный парсинг и написание базового кода происходят локально, а дорогие токены тратятся только там, где реально нужен сильный резонинг.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад