Склад в Сан-Леандро, Калифорния. Оператор по имени Эндрю Сея аккуратно вытаскивает деревянные блоки из шаткой башни Дженга. На голове у него гарнитура с камерой и датчиками мозговых волн. Записывается всё: куда смотрит, что делает руками, и – что совсем нетривиально – что в этот момент происходит в его голове. Это не нейронаучный эксперимент ради академической статьи. Это производство данных для обучения роботов, которых в мире пока катастрофически мало.
Компания Encord работает на пересечении двух трендов: роста физического ИИ (гуманоидные и складские роботы) и острейшего дефицита обучающих данных для него. Если языковые модели строились на тексте, который просто лежал в интернете – Stack Overflow, Википедия, миллиарды веб-страниц, то с роботами так не получится. Физический мир не оцифрован. Данные приходится не собирать, а буквально производить.
Это принципиальный момент, который часто недооценивают. Успех ChatGPT и других LLM во многом объясняется тем, что обучение на тексте обошлось frontier-лабораториям почти ничего: данные уже существовали, их просто нужно было собрать. Стоимость разметки была копеечной в сравнении с вычислениями.
С физическим ИИ экономика принципиально иная. Vineeth Velmurugan, руководитель направления robot learning в Encord (до этого работал в роботной лаборатории OpenAI и складском автоматизаторе Berkshire Grey), формулирует проблему прямо: «Данных просто не существует». По его оценке, чтобы пробить потолок в робототехнике, нужен датасет примерно в пять раз больше всего видеокорпуса YouTube. Это не цифра для красного словца – это указание на масштаб разрыва между тем, что есть, и тем, что нужно.
]
Видеозаписи, конечно, помогают – компании по автономному вождению давно этим занимаются. Но видео даёт картинку, а не ощущение: в нём нет силы нажатия, нет информации о том, насколько предмет скользкий или хрупкий. Робот, обученный только на видео, знает как выглядит захват, но не знает как он ощущается. Это граница, которую Encord пытается сдвинуть.
Гарнитура на голове Сеи сделана немецким нейронаучным стартапом Zander Labs. Идея за ней не такая экзотическая, как звучит. Нейробиолог Zander Лукас Герке объясняет: уровень мозговой активности в каждый момент задачи говорит о многом. Когда оператор удивлён, совершает ошибку или концентрируется на чём-то сложном – это видно в паттерне волн. Для разработчика модели это ценная информация: вот момент, где человеку трудно, значит именно здесь роботу нужно задействовать более ресурсоёмкую обработку.
Сотрудничество с Zander пока на стадии пилота. Encord хочет сначала собрать начальный датасет с размеченными мозговыми волнами, прогнать его через модели клиентов-робототехников, и только потом решать – масштабировать или нет. Это рациональный подход: не объявлять революцию, пока нет цифр. Здесь, кстати, стоит уточнить: сам факт эксперимента не означает, что технология работает. Это именно что попытка выяснить, работает ли она.
Параллельно в лаборатории тестируют другой модальный подход: сенсоры на предплечье, которые считывают электрические сигналы мышц. Камеры, снимающие работу рук, часто не захватывают всю кисть целиком. Сенсоры на предплечье позволяют построить 3D-модель положения руки в каждый момент времени – что даёт модели более полную картину манипуляции объектом.
Склад в Сан-Леандро – это своего рода фабрика по производству физических данных. На стеллажах стоят вазы с искусственными цветами, книги, пластиковые овощи, лотки для кошачьего наполнителя, связки проводов. Всё это реквизит для отработки конкретных навыков манипуляции. Пилоты – так в Encord называют операторов – переливают кофе из кофейника в кружки, складывают фишки для покера, подключают и отключают Ethernet-кабели от задней панели сервера.
Последнее задание особенно показательно. Работа с кабелями на задней панели сервера – мечта операторов дата-центров: если автоматизировать, экономия огромная. Но пока это за пределами возможностей роботов. Журналист TechCrunch, попробовавший поуправлять манипулятором, описывает опыт точно: захваты гораздо менее ловкие, чем человеческие пальцы, и степеней свободы катастрофически не хватает. Вот почему данные нужны именно для тонкой настройки, а не просто «больше данных».
Ещё один источник данных – «эгоцентрическое» видео: операторы по всему миру носят камеры на голове и снимают реальные производственные процессы. Это дополняется телеоперацией через leader-follower риги: две роботизированные руки, одна под управлением человека, вторая копирует её движения и одновременно записывает всё для обучения.
Velmurugan приводит конкретное соотношение: плотно аннотированные данные (с текстовым описанием каждого действия – например, «правая рука затягивает болт») стоят в 20 раз дороже «мусорного эго-видео», но при этом в 100 раз ценнее для обучения конкретным задачам. На бумаге это отличная сделка. На практике – «в 20 раз дороже» это реальные деньги, особенно при масштабировании.
Именно здесь разрушается привычная аналогия между физическим ИИ и языковыми моделями. LLM-лаборатории скачивали интернет буквально бесплатно. Производство физических данных требует складов, оборудования, операторов, аннотаторов. Это ближе к производству чипов, чем к скачиванию датасета. И это меняет всю логику того, кто может и кто не может строить такие модели.
Интересно, что позиция Encord на рынке – работать с множеством робототехнических компаний одновременно – даёт ему своеобразное конкурентное преимущество. Velmurugan говорит, что видит тенденции по всей индустрии раньше любого отдельного клиента: какие техники работают, какие нет, где прорывы, где тупики. Это классический AI агентства сетевой эффект, только применённый к данным, а не к программному обеспечению.
Два оператора, упомянутых в материале – Эндрю Сея и София Инфанте – раньше работали в Scale AI, другой компании по разметке данных. Сея до этого следил за роботизированным сортировщиком мусора. Теперь он играет в Дженга для нейросетей и говорит, что ему нравится: «Каждый день что-то новое». Это штрих к более широкой картине: возникает целый класс специалистов, которые не пишут код и не тренируют модели, а буквально производят сырьё для них своими руками.
Аналогия с промышленностью тут не метафора, а описание реальности. Если языковой ИИ напоминал информационную экономику – масштабируемую, с нулевой предельной стоимостью копирования – то физический ИИ возвращает нас к логике мануфактуры. Данные надо производить. Это требует людей, пространства, инструментов.
]
История Encord – не только про роботов. Это иллюстрация более общего принципа: качество ИИ-системы определяется не только архитектурой модели, но и качеством данных, на которых она обучена. В маркетинге и контенте это работает ровно так же – только там «данные» это понимание аудитории, тональность, контекст бренда.
Компании, которые сегодня инвестируют в качественные данные для своих ИИ-систем – будь то контент-завод на ИИ или система обучения роботов – строят актив, который конкуренты не смогут просто скачать. Это принципиальный сдвиг по сравнению с эпохой, когда казалось, что достаточно подключиться к нужному API.
Детали вроде мозговых волн над башней Дженга кажутся экзотикой. Но за ними стоит вопрос, который так или иначе стоит перед каждым бизнесом, строящим что-то на ИИ: откуда берутся данные, на которых учится ваша система, и насколько они лучше того, что есть у конкурентов? Encord пытается дать на него ответ в робототехнике. В вашей отрасли вопрос, скорее всего, тот же самый – просто с другими датчиками.
