Твой ноутбук с RTX 4060 и восемью гигабайтами видеопамяти теперь способен на 39,3 токена в секунду на 35-миллиардной модели — это быстрее, чем медианная скорость декода Codex в проде. Разгадка не в новой видеокарте, а в новом движке: FreeToken — инференс-движок для MoE-моделей, который сделала команда авторов vLLM и SGLang. И это меняет расклад для всех, у кого нет пары RTX PRO 6000 за цену подержанной машины.
Почему запуск ИИ локально упирался в софт, а не в железо
Долгое время казалось, что запуск больших моделей — вопрос денег: чем толще кошелёк, тем жирнее модель. Но авторы FreeToken проверили это на реальных агентных сценариях — SWE-задачах через OpenCode и Claude Code, почтовом агенте через OpenClaw — и выяснили: существующие движки просто не выжимают всю пропускную способность шины и памяти хоста. В одиночном промпте это незаметно. А вот в агентной сессии, где контекст растёт с каждым вызовом инструмента и префилл прогоняется заново на каждом шаге, узкое место софта бьёт по всей системе.
Ключевая метрика здесь — TTFT (time to first token), задержка до первого символа ответа. В агенте это не «время ожидания ответа», а стоимость каждого шага между действиями агента. И тут разница драматическая: худший TTFT за сессию у FreeToken — 44 секунды, у llama.cpp — 232, у KTransformers — 946. Последнее — это уже не медленно, это агент падает по таймауту: у OpenClaw watchdog срабатывает через 120 секунд простоя.
ИИ-чат MyKreaTool — попробовать ChatGPT, Claude и Gemini в одном окне. Прямо на MyKreaTool.Открыть инструмент →
MoE-архитектура: как локальные модели ИИ помещаются в 8 ГБ
Секрет в том, что запуск больших ИИ-моделей на слабом железе вообще возможен благодаря архитектуре Mixture of Experts. В плотной модели каждый токен требует прогрузки всех параметров целиком. В MoE-модели роутер на каждом токене активирует лишь малую часть «экспертов»: у модели 30B-A3B из тридцати миллиардов параметров реально работают только три миллиарда. Отсюда правило: объём памяти зависит от общего числа параметров, а скорость генерации — от активного. Именно поэтому MoE модели на GPU уровня RTX 4060 внезапно становятся рабочим инструментом, а не игрушкой для бенчмарков.
Что это значит для вас: быстрый ИИ на вашем устройстве
Если вы фрилансер или предприниматель и держите ИИ-агентов на облачных API ради экономии на железе — стоит присмотреться к vLLM FreeToken как альтернативе: локальные ИИ-модели такого масштаба избавляют от счетов за токены и утечки данных в чужое облако. Ноутбучная RTX 4060 внезапно оказывается достаточной базой для собственного AI-агента — были бы правильные MoE-веса и движок, который умеет их правильно кормить.
Часто задаваемые вопросы
Что такое FreeToken и чем он отличается от других решений?
FreeToken — это движок для локального инференса MoE-моделей, разработанный командой vLLM. Его главное отличие — невероятная эффективность, позволяющая запускать большие модели (например, 35B) на относительно слабом железе, таком как ноутбучная RTX 4060, с высокой скоростью.
Действительно ли FreeToken работает на обычной RTX 4060?
Да, согласно статье, FreeToken демонстрирует 39.3 tok/s на 35-миллиардной модели, используя ноутбучную RTX 4060 с 8GB VRAM. Это достигается за счет оптимизации программного обеспечения, а не требованием к дорогому железу.
Как я могу использовать FreeToken в своем бизнесе или работе?
FreeToken открывает возможности для локальной генерации контента (маркетинг, блогинг), быстрого прототипирования ИИ-решений, анализа данных с сохранением конфиденциальности и снижения затрат на облачные вычисления. Вы можете экспериментировать с мощными моделями без ограничений.
Что такое MoE-архитектура и почему она позволяет запускать большие модели на слабом GPU?
В Mixture of Experts роутер активирует на каждом токене лишь малую часть «экспертов»: у модели 30B-A3B из тридцати миллиардов параметров реально работают только три миллиарда. Объём видеопамяти зависит от общего числа параметров, а скорость генерации — только от активного, поэтому такие модели помещаются в 8 ГБ RTX 4060.
Почему TTFT (время до первого токена) важнее скорости генерации для ИИ-агентов?
В агентной сессии контекст растёт с каждым вызовом инструмента, и префилл прогоняется заново на каждом шаге, поэтому TTFT — это стоимость каждого действия агента, а не разовая задержка. Худший TTFT у FreeToken за сессию — 44 секунды, у llama.cpp — 232, у KTransformers — 946: последнее уже приводит к падению агента по таймауту watchdog.
Чем FreeToken лучше существующих движков вроде llama.cpp или KTransformers?
Разница не в средней скорости генерации, а в худшем TTFT за агентную сессию: 44 секунды у FreeToken против 232 у llama.cpp и 946 у KTransformers. Авторы FreeToken выжимают пропускную способность шины и памяти хоста эффективнее, что критично именно в многошаговых агентных сценариях, а не в одиночных промптах.
Кому подходит локальный инференс через FreeToken?
Прежде всего фрилансерам и предпринимателям, которые держат ИИ-агентов на облачных API ради экономии на железе. Локальный запуск моделей такого масштаба на обычной RTX 4060 избавляет от счетов за токены и от передачи данных в чужое облако, сохраняя конфиденциальность.
Материал подготовлен на основе открытых источников и носит исключительно информационный характер. Он не является индивидуальной рекомендацией, юридической, финансовой или иной профессиональной консультацией. Названия, логотипы и товарные знаки принадлежат их правообладателям. Редакция не несёт ответственности за решения, принятые на основе этой публикации, и за содержание внешних ссылок. Мнение редакции может не совпадать с позицией упомянутых компаний.
Комментарии 0