Твой ноутбук с RTX 4060 и восемью гигабайтами видеопамяти теперь способен на 39,3 токена в секунду на 35-миллиардной модели — это быстрее, чем медианная скорость декода Codex в проде. Разгадка не в новой видеокарте, а в новом движке: FreeToken — инференс-движок для MoE-моделей, который сделала команда авторов vLLM и SGLang. И это меняет расклад для всех, у кого нет пары RTX PRO 6000 за цену подержанной машины.

Почему запуск ИИ локально упирался в софт, а не в железо

Долгое время казалось, что запуск больших моделей — вопрос денег: чем толще кошелёк, тем жирнее модель. Но авторы FreeToken проверили это на реальных агентных сценариях — SWE-задачах через OpenCode и Claude Code, почтовом агенте через OpenClaw — и выяснили: существующие движки просто не выжимают всю пропускную способность шины и памяти хоста. В одиночном промпте это незаметно. А вот в агентной сессии, где контекст растёт с каждым вызовом инструмента и префилл прогоняется заново на каждом шаге, узкое место софта бьёт по всей системе.

Ключевая метрика здесь — TTFT (time to first token), задержка до первого символа ответа. В агенте это не «время ожидания ответа», а стоимость каждого шага между действиями агента. И тут разница драматическая: худший TTFT за сессию у FreeToken — 44 секунды, у llama.cpp — 232, у KTransformers — 946. Последнее — это уже не медленно, это агент падает по таймауту: у OpenClaw watchdog срабатывает через 120 секунд простоя.

ИИ-чат MyKreaTool — попробовать ChatGPT, Claude и Gemini в одном окне. Прямо на MyKreaTool.Открыть инструмент →

MoE-архитектура: как локальные модели ИИ помещаются в 8 ГБ

Секрет в том, что запуск больших ИИ-моделей на слабом железе вообще возможен благодаря архитектуре Mixture of Experts. В плотной модели каждый токен требует прогрузки всех параметров целиком. В MoE-модели роутер на каждом токене активирует лишь малую часть «экспертов»: у модели 30B-A3B из тридцати миллиардов параметров реально работают только три миллиарда. Отсюда правило: объём памяти зависит от общего числа параметров, а скорость генерации — от активного. Именно поэтому MoE модели на GPU уровня RTX 4060 внезапно становятся рабочим инструментом, а не игрушкой для бенчмарков.

Что это значит для вас: быстрый ИИ на вашем устройстве

Если вы фрилансер или предприниматель и держите ИИ-агентов на облачных API ради экономии на железе — стоит присмотреться к vLLM FreeToken как альтернативе: локальные ИИ-модели такого масштаба избавляют от счетов за токены и утечки данных в чужое облако. Ноутбучная RTX 4060 внезапно оказывается достаточной базой для собственного AI-агента — были бы правильные MoE-веса и движок, который умеет их правильно кормить.