Данные для обучения роботов: почему мозговые волны стали новым сырьём физического ИИ

Фабио Де ЛукаИИ и автоматизация3 недели назад59 Просмотры

Склад в Сан-Леандро, Калифорния. Оператор по имени Эндрю Сея аккуратно вытаскивает деревянные блоки из шаткой башни Дженга. На голове у него гарнитура с камерой и датчиками мозговых волн. Записывается всё: куда смотрит, что делает руками, и – что совсем нетривиально – что в этот момент происходит в его голове. Это не нейронаучный эксперимент ради академической статьи. Это производство данных для обучения роботов, которых в мире пока катастрофически мало.

Компания Encord работает на пересечении двух трендов: роста физического ИИ (гуманоидные и складские роботы) и острейшего дефицита обучающих данных для него. Если языковые модели строились на тексте, который просто лежал в интернете – Stack Overflow, Википедия, миллиарды веб-страниц, то с роботами так не получится. Физический мир не оцифрован. Данные приходится не собирать, а буквально производить.

Почему «скачать из интернета» не работает

Это принципиальный момент, который часто недооценивают. Успех ChatGPT и других LLM во многом объясняется тем, что обучение на тексте обошлось frontier-лабораториям почти ничего: данные уже существовали, их просто нужно было собрать. Стоимость разметки была копеечной в сравнении с вычислениями.

С физическим ИИ экономика принципиально иная. Vineeth Velmurugan, руководитель направления robot learning в Encord (до этого работал в роботной лаборатории OpenAI и складском автоматизаторе Berkshire Grey), формулирует проблему прямо: «Данных просто не существует». По его оценке, чтобы пробить потолок в робототехнике, нужен датасет примерно в пять раз больше всего видеокорпуса YouTube. Это не цифра для красного словца – это указание на масштаб разрыва между тем, что есть, и тем, что нужно.

type=stat_card | about=масштаб дефицита данных для обучения физического ИИ — нужен датасет в 5 раз больше YouTube | stat=×5 vs YouTube | caption=Столько данных нужно физическому ИИ | visual=dark backg]

Видеозаписи, конечно, помогают – компании по автономному вождению давно этим занимаются. Но видео даёт картинку, а не ощущение: в нём нет силы нажатия, нет информации о том, насколько предмет скользкий или хрупкий. Робот, обученный только на видео, знает как выглядит захват, но не знает как он ощущается. Это граница, которую Encord пытается сдвинуть.

Мозговые волны как метаданные к движению

Гарнитура на голове Сеи сделана немецким нейронаучным стартапом Zander Labs. Идея за ней не такая экзотическая, как звучит. Нейробиолог Zander Лукас Герке объясняет: уровень мозговой активности в каждый момент задачи говорит о многом. Когда оператор удивлён, совершает ошибку или концентрируется на чём-то сложном – это видно в паттерне волн. Для разработчика модели это ценная информация: вот момент, где человеку трудно, значит именно здесь роботу нужно задействовать более ресурсоёмкую обработку.

Сотрудничество с Zander пока на стадии пилота. Encord хочет сначала собрать начальный датасет с размеченными мозговыми волнами, прогнать его через модели клиентов-робототехников, и только потом решать – масштабировать или нет. Это рациональный подход: не объявлять революцию, пока нет цифр. Здесь, кстати, стоит уточнить: сам факт эксперимента не означает, что технология работает. Это именно что попытка выяснить, работает ли она.

Параллельно в лаборатории тестируют другой модальный подход: сенсоры на предплечье, которые считывают электрические сигналы мышц. Камеры, снимающие работу рук, часто не захватывают всю кисть целиком. Сенсоры на предплечье позволяют построить 3D-модель положения руки в каждый момент времени – что даёт модели более полную картину манипуляции объектом.

Что происходит внутри склада

Склад в Сан-Леандро – это своего рода фабрика по производству физических данных. На стеллажах стоят вазы с искусственными цветами, книги, пластиковые овощи, лотки для кошачьего наполнителя, связки проводов. Всё это реквизит для отработки конкретных навыков манипуляции. Пилоты – так в Encord называют операторов – переливают кофе из кофейника в кружки, складывают фишки для покера, подключают и отключают Ethernet-кабели от задней панели сервера.

Последнее задание особенно показательно. Работа с кабелями на задней панели сервера – мечта операторов дата-центров: если автоматизировать, экономия огромная. Но пока это за пределами возможностей роботов. Журналист TechCrunch, попробовавший поуправлять манипулятором, описывает опыт точно: захваты гораздо менее ловкие, чем человеческие пальцы, и степеней свободы катастрофически не хватает. Вот почему данные нужны именно для тонкой настройки, а не просто «больше данных».

Ещё один источник данных – «эгоцентрическое» видео: операторы по всему миру носят камеры на голове и снимают реальные производственные процессы. Это дополняется телеоперацией через leader-follower риги: две роботизированные руки, одна под управлением человека, вторая копирует её движения и одновременно записывает всё для обучения.

Экономика данных, которые нельзя скачать

Velmurugan приводит конкретное соотношение: плотно аннотированные данные (с текстовым описанием каждого действия – например, «правая рука затягивает болт») стоят в 20 раз дороже «мусорного эго-видео», но при этом в 100 раз ценнее для обучения конкретным задачам. На бумаге это отличная сделка. На практике – «в 20 раз дороже» это реальные деньги, особенно при масштабировании.

Именно здесь разрушается привычная аналогия между физическим ИИ и языковыми моделями. LLM-лаборатории скачивали интернет буквально бесплатно. Производство физических данных требует складов, оборудования, операторов, аннотаторов. Это ближе к производству чипов, чем к скачиванию датасета. И это меняет всю логику того, кто может и кто не может строить такие модели.

Интересно, что позиция Encord на рынке – работать с множеством робототехнических компаний одновременно – даёт ему своеобразное конкурентное преимущество. Velmurugan говорит, что видит тенденции по всей индустрии раньше любого отдельного клиента: какие техники работают, какие нет, где прорывы, где тупики. Это классический AI агентства сетевой эффект, только применённый к данным, а не к программному обеспечению.

Люди за рычагами новой индустрии

Два оператора, упомянутых в материале – Эндрю Сея и София Инфанте – раньше работали в Scale AI, другой компании по разметке данных. Сея до этого следил за роботизированным сортировщиком мусора. Теперь он играет в Дженга для нейросетей и говорит, что ему нравится: «Каждый день что-то новое». Это штрих к более широкой картине: возникает целый класс специалистов, которые не пишут код и не тренируют модели, а буквально производят сырьё для них своими руками.

Аналогия с промышленностью тут не метафора, а описание реальности. Если языковой ИИ напоминал информационную экономику – масштабируемую, с нулевой предельной стоимостью копирования – то физический ИИ возвращает нас к логике мануфактуры. Данные надо производить. Это требует людей, пространства, инструментов.

type=diagram | about=цепочка производства данных для обучения физического ИИ: от оператора с датчиками до готовой модели | steps=Оператор с датчиками -> Запись движений и мозговых волн -> Разметка и а]

Что это значит за пределами робототехники

История Encord – не только про роботов. Это иллюстрация более общего принципа: качество ИИ-системы определяется не только архитектурой модели, но и качеством данных, на которых она обучена. В маркетинге и контенте это работает ровно так же – только там «данные» это понимание аудитории, тональность, контекст бренда.

Компании, которые сегодня инвестируют в качественные данные для своих ИИ-систем – будь то контент-завод на ИИ или система обучения роботов – строят актив, который конкуренты не смогут просто скачать. Это принципиальный сдвиг по сравнению с эпохой, когда казалось, что достаточно подключиться к нужному API.

Детали вроде мозговых волн над башней Дженга кажутся экзотикой. Но за ними стоит вопрос, который так или иначе стоит перед каждым бизнесом, строящим что-то на ИИ: откуда берутся данные, на которых учится ваша система, и насколько они лучше того, что есть у конкурентов? Encord пытается дать на него ответ в робототехнике. В вашей отрасли вопрос, скорее всего, тот же самый – просто с другими датчиками.

type=cta | about=создание качественных ИИ-систем и данных для обучения моделей под задачи бизнеса | hook=Ваши данные умнее конкурентов? | link=https://fabiodeluca.ru/avtomatizaczii-s-ii/ii-agenty/

Соц. сети
  • Pinterest1360
  • Youtube1285
  • WhatsApp
  • Telegram1608
  • VKontakte102
  • TikTok1059
Loading Next Post...
Боковая панель Поиск
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...