Показал один раз, и машина запомнила: Generalist привлёк ещё $200 млн на новый подход к обучению роботов

Следующий большой прорыв в ИИ может произойти уже не на экране, а в физическом мире.


kgv4y3irv4brupisxxymxwrpl43nctom.jpg

Generalist получил почти $200 млн новых инвестиций и теперь оценивается в $3 млрд. Вместе с июньским раундом стартап привлёк уже $600 млн. Инвесторы делают ставку на технологию, которая должна научить роботов быстрее осваивать новые действия и меньше зависеть от долгой настройки под каждую задачу.

Всего за несколько дней до новости о финансировании Generalist представила модель GEN-1.5 . Компания утверждает, что роботу достаточно одной демонстрации длительностью от 3 до 12 секунд, после которой машина сразу пытается повторить показанное без дополнительного обучения . В тестах на десяти коротких задачах средняя успешность достигла 59%, поэтому до безошибочных универсальных роботов пока далеко.

Механизм напоминает обучение через показ. В контекст GEN-1.5 помещают короткий пример движения, после чего модель управляет роботом и воспроизводит действие. В отдельных опытах человек показывал задачу собственными руками перед камерами, а машина повторяла её сама. Модель также смогла объединить два отдельных навыка в одну последовательность и перенести демонстрацию из симуляции в реальный мир.

Generalist идёт дальше простой имитации. Предыдущую GEN-1 обучали на более чем 500 тысячах часов физических взаимодействий с примерно 9000 вариантами захватов и инструментов. Разработчики хотят создать единый «мозг», способный работать с разными роботами и механическими руками, чтобы под каждую новую конструкцию не приходилось создавать интеллект практически заново.

Практический смысл такого подхода заключается в более простом обучении машин новым операциям. Вместо длительной подготовки под каждую задачу робот в перспективе сможет получить несколько физических примеров и адаптироваться к новому инструменту или обстановке. Generalist рассчитывает применять подобный интеллект в роботах для фабрик, складов, лабораторий, ресторанов, ферм и домов.

Однако нынешние демонстрации GEN-1.5 пока состоят из коротких и сравнительно простых действий, а обучение с одного показа срабатывает далеко не всегда. Инвесторы уже рассчитывают на собственный «момент ChatGPT» для робототехники , когда одной машине не потребуется отдельное обучение для каждой операции, но создание действительно универсальных моделей может занять ещё несколько лет.