5 октября 2026 года компания Reka AI открыла исследовательское превью модели Rho-1 — это универсальный ИИ для роботов и контента сразу: 19 миллиардов параметров, а внутри одной нейросети живут текст, картинки, видео и управление железом. Один и тот же набор весов и «смотрит» на мир через камеру, и двигает манипулятор, и отвечает текстом. Такой универсальный ИИ работает без внешних моделей-помощников: все задачи идут как токены в общем контекстном окне, без вызовов сторонних инструментов. Обучение заняло около трёх месяцев на 320 ускорителях H100.

Почему это не просто ещё одна модель

Слово «мультимодальная нейросеть» звучит скучно, но за ним стоит простая вещь: это ИИ, который умеет работать не с одним типом данных, а с несколькими — текстом, картинками, видео, звуком. Раньше почти все такие системы были хитрыми диспетчерами: приходит задача с видео — перекидываем её отдельной модели для видео, приходит текст — другой модели. Rho-1 устроен иначе. Все типы данных лежат в одном общем окне, как записи в одном блокноте, и модель обрабатывает их одним потоком.

Дальше — самое интересное. Модель генерирует непрерывное видео в реальном времени и реагирует на новые команды прямо на ходу, без перезапуска. То есть ты говоришь ей что-то новое, пока она уже работает, и она продолжает с учётом этой команды. И те же самые веса, которые предсказывают картинку с камеры, управляют движениями робота.

Отдельная боль — данных для обучения роботов не хватало. Reka AI обошла это красиво: построила модель обратной динамики, которая вытаскивает сигналы управления из обычных видео из интернета. Проще говоря, модель училась на роликах, снятых людьми, и вытаскивала оттуда подсказки, как двигается предмет или рука.

Reka AI в мультимодальности не новичок: в апреле 2024 года она выпустила Reka Core — мультимодальную языковую модель, которая на тестах конкурировала с GPT-4, Claude 3 и Gemini Ultra. А сегодняшний релиз вписывается в общий тренд исследований в сторону так называемых «мировых моделей» — ИИ, который не просто болтает, а как-то понимает физику происходящего вокруг.

Что это даёт лично тебе

Мама двоих детей, ведёт семейный бюджет. У неё на телефоне видео с кружка робототехники сына и куча чеков. Одна модель — вместо пяти приложений — разберёт видео, вытащит из него текст с доски, посчитает расходы за месяц. Сегодня это уже делают мультимодальные модели, а Rho-1 показывает, куда всё идёт.

Владелец небольшой кофейни. Камера висит над барной стойкой, видео копится часами. Универсальный ИИ-помощник смотрит это видео и отвечает на вопрос: «В какие часы очередь дольше всего и сколько людей уходит, не дождавшись?» Раньше для этого нанимали человека или ставили отдельную систему видеоаналитики.

Фрилансер-дизайнер. Клиент просит показать логотип в движении. Вместо монтажной программы и трёх часов возни — закидываешь картинку, получаешь видео и тут же правишь по ходу: «сделай помедленнее, добавь тень». Модель не перезапускается, она реагирует на лету.

Репетитор по физике. Он снял опыт с маятником на телефон и просит ИИ разобрать по кадрам, где теряется энергия, и объяснить это простыми словами. Один инструмент вместо «видеоредактор + переводчик + поисковик».

Мастер на маленьком производстве. Сейчас, чтобы робот-манипулятор что-то делал, нужно три подрядчика: один настраивает зрение, второй — движение, третий — интерфейс. Rho-1 намекает, что всё это может быть одной системой. Значит, через полгода-год порог входа для автоматизации мастерской станет заметно ниже.

Монтажёр и блогер. ИИ для работы с видео перестаёт быть отдельной профессией внутри профессии. Ты просто описываешь, что хочешь видеть, и правишь по ходу — как будто у тебя живой оператор, который понимает слова.

Как попробовать прямо сейчас

Важный момент: Rho-1 — это исследовательское превью, публичного доступа к управлению роботами у обычного человека нет. Но логику универсального ИИ можно прощупать уже сегодня, чтобы не отстать.

1. Зайди на сайт Reka AI и найди раздел с Rho-1 (research preview). Посмотри, что именно показывает компания: демо, описание, примеры. Это займёт 10 минут и даст тебе понимание тренда лучше, чем десять пересказов в ленте.

2. Начни с бесплатного тренажёра — ChatGPT. Открой диалог и прикрепи к сообщению видео или картинку. Технически это и есть та самая мультимодальность: один инструмент, разные типы данных.

3. Задай первый рабочий вопрос. Например: «Вот видео с моей кухни. Опиши по шагам, что происходит, и скажи, что тут можно автоматизировать».

4. Собери свой список рутины. Выпиши 5 дел, где нужны глаза и руки одновременно: разбор видео, проверка товара, сортировка, монтаж, учёт. Это твоя карта задач под будущие роботы.

5. Проверь на одном пункте сегодня. Выбери самое нудное и попробуй решить его через чат: пусть ИИ разберёт видео или фото и выдаст готовый текст, план или таблицу.

Что получится: ты поймёшь, как формулировать задачи для машины, которая видит и слышит. Когда такие модели доберутся до бытовых роботов, у тебя уже будет навык.

ИИ-чат MyKreaTool — попробовать ChatGPT, Claude и Gemini в одном окне. Прямо на MyKreaTool.Открыть инструмент →

Плюсы и что изменится

Плюс первый — всё крутится в одной нейросети. Не надо собирать зоопарк из пяти моделей и платить за каждую. Одно общее окно контекста на все модальности, без вызовов инструментов и внешних моделей.

Плюс второй — скорость. Реакция на новую команду без перезапуска означает, что работа идёт потоком, как разговор, а не как отправка заявки в офис.

Плюс третий — эффект обучения на чужих видео. Раз контрольные сигналы можно вытянуть из обычных роликов из интернета, значит, обучение роботов перестаёт упираться в дорогие полигоны и часы съёмок.

Что станет возможным для обычного человека: голосовые и видеоинтерфейсы вместо кнопок, автоматизация мелких производств и мастерских, домашние помощники, которые реально понимают обстановку в комнате, а не просто включают свет по таймеру.

Минусы, честно. Это исследовательское превью, а не продукт для скачивания. Роботов у тебя дома пока нет, а робототехника стоит дорого и требует железа. Плюс сама нехватка данных для обучения роботов никуда не исчезла — её обошли хитрым приёмом, но это не значит, что завтра любой желающий соберёт себе андроида из подручного.

Что делать прямо сегодня

Зайди в ChatGPT, прикрепи любое своё видео или фото и попроси разобрать его по шагам. Это 5 минут, ноль рублей и первый реальный навык работы с универсальным ИИ. А потом напиши в комментарии у @aigoby, что у тебя получилось и какую рутину ты хочешь отдать машине — соберём вместе список задач, которые ИИ уже готов взять на себя.

🎁 Бонус: промпт для разбора любого видео

Скопируй и вставь в чат — подойдёт для любой мультимодальной модели, которая принимает видео или картинки.

```text

Ты — внимательный универсальный ИИ-помощник. Я прикрепляю видео (или фото).

Сделай разбор по шагам:

1. Опиши коротко, что происходит, по порядку — как будто рассказываешь другу.

2. Выпиши всё, что можно прочитать на экране: текст, цифры, надписи.

3. Найди 3 повторяющихся действия — это кандидаты на автоматизацию.

4. Для каждого предложи простое решение: что можно делегировать программе,

а что пока требует человека.

5. Задай мне 3 вопроса, ответы на которые уточнят задачу.

Пиши простым русским языком, без технического жаргона, списками.

```