Стартап PrismML запустил ИИ Qwen3.6-27B прямо на iPhone: младшая версия модели весит всего 3,9 ГБ вместо стандартных 54 ГБ и при этом сохраняет 90% "интеллекта" оригинала. Веса модели — по сути, лишь -1 и +1, то есть по 1,125 бита на параметр, но благодаря общим FP16-множителям на каждые 128 весов точность почти не проседает. Это первая 27-миллиардная нейросеть на телефоне, которая реально помещается в память и работает без единого запроса к облаку.
Как локальный ИИ на телефон без интернета поместился в память смартфона
Проблема была чисто инженерная. В 16-битной точности Qwen3.6-27B занимает около 54 ГБ, даже урезанная 4-битная сборка тянет на 18 ГБ — ни один телефон это не потянет. iPhone 17 Pro Max, на котором PrismML показывала демо, имеет 12 ГБ памяти, но iOS выделяет одному приложению не больше 6 ГБ, и туда должна влезть еще и растущая KV-кэш вместе с активациями.
PrismML выпустила две версии Bonsai 27B: тернарную (5,9 ГБ, веса {-1, 0, +1}) для ноутбуков и слабых видеокарт, и бинарную (3,9 ГБ, только {-1, +1}) — экстремальное сжатие специально под нейросеть на телефоне. Причем низкая битность применена ко всей сети целиком — эмбеддингам, вниманию, MLP-слоям, без "островков" повышенной точности, которые обычно раздувают реальный размер модели.
Что теряется при сжатии локальных моделей ИИ до 1 бита
Компания прогнала обе версии через 15 бенчмарков. Математика почти не пострадала (95,3 у оригинала против 91,7 у бинарной версии), программирование просело умеренно, а вот агентные задачи и вызов инструментов ощутили удар сильнее всего — с 80,0 до 66,0 балла. Это неприятно именно потому, что PrismML позиционирует Bonsai 27B как автономный ИИ для агентных сценариев — вызова функций, работы со скриншотами, рассуждений на телефоне без сети.
Зато модель сохранила контекст в 262 тысячи токенов, мультимодальность и поддержку спекулятивного декодирования — то есть по функциональности это полноценная копия оригинала, просто сжатая.
Зачем локальный ИИ агент нужен предпринимателю и фрилансеру
Офлайн нейросеть такого уровня — это не игрушка. Она решает конкретную боль: работа с конфиденциальными данными без утечки в облако, автоматизация в местах без стабильного интернета, независимость от лимитов и цен API. Если у вас есть задачи вроде разбора документов, черновой генерации текста или анализа скриншотов прямо на устройстве — офлайн ИИ такого масштаба еще полгода назад казался фантастикой.
Стоит ли скачать ИИ на телефон и пробовать прямо сейчас
Пока рано. На iPhone 17 Pro Max бинарная версия выдает лишь 11 токенов в секунду — диалог ощущается медленным. Релиз сырой: LM Studio и Unsloth формат на старте не поддерживали, для Apple нужен фирменный форк MLX, а Android пока официально не в списке. Но веса уже лежат на Hugging Face под лицензией Apache 2.0 — так что через пару месяцев, когда экосистема дозреет, это будет один из главных инструментов для тех, кто хочет ИИ на смартфоне без подписок и облака.



Комментарии 0