Использование ИИ-агентов для подготовки 3D-сцен к симуляции
Public- 17 Sep, 2026

Инженеры по симуляции робототехники постоянно упираются в одно и то же узкое место, и оно почти не связано с политиками, моделями или циклами обучения. Самое сложное часто начинается ещё до того, как что-то учится: у робота по-прежнему нет готового к симуляции мира, в котором можно тренироваться. Довести 3D-сцену из файла Blender до состояния, пригодного для симулятора, — работа нудная, однообразная и лёгкая в плане ошибок, и она часто выходит за рамки обязанностей инженера по симуляции. Именно в этой подготовительной работе и могут помочь агентные системы, если у них есть нужные инструменты.
Описанный здесь рабочий процесс связывает рассуждение, выполнение инструментов и проверку в единый повторяемый процесс. Codex на базе OpenAI GPT-6 Astra выступает оркестратором, который ставит цель, интерпретирует результаты и направляет итерации. Специализированные субагенты, собранные на каркасе Hermes agent и развёрнутые через NVIDIA NemoClaw, вызывают NVIDIA Omniverse Libraries, чтобы осмотреть сцену, сформировать метаданные симуляции, настроить физику и отрисовать визуальные предпросмотры. Стек отталкивается от конкретной цели: на входе сцена Blender, цель — мир, готовый к робототехнике, на выходе — сцена на базе USD, готовая к симуляции, место назначения — Isaac Sim или Isaac Lab, а проверка сочетает визуальный предпросмотр с проверками SimReady.
Первый субагент подключается к Blender через сервер Model Context Protocol (MCP) и описывает сцену, а не гадает по скриншотам. Он может вызывать инструменты для осмотра объектов, коллекций, трансформаций, материалов, камер, источников света и метаданных сцены, возвращая структурированное описание, которое становится общим контекстом для остальных агентов. В примере результата насчитывается 142 объекта и 37 материалов, а заодно помечается отсутствие семантических меток, коллизионных мешей, сенсоров камеры и физических материалов. Astra использует это описание вместе с задачей робототехники, чтобы выявить недостающую информацию, спланировать следующие задачи и передать их с чёткими критериями приёмки.


Затем описание переходит к специализированным агентам, которые уже воздействуют на сцену. Агент авторинга USD сохраняет иерархию, трансформации, материалы, метки, физические метаданные и определения сенсоров, опираясь на слоистую, неразрушающую композицию USD, чтобы агенты могли обогащать мир, не уплощая исходный арт. Агент семантической разметки превращает безымянные меши в объекты, осмысленные для задачи, — полки, контейнеры, полы, препятствия, предметы для захвата и цели робота, — выводя метки из имён, иерархии, формы и контекста и помечая неопределённое. В демо оказались размечены 118 примов, а 9 меток оставлены на проверку человеком. Агент материалов переводит визуальный вид в полезные для симуляции метаданные, распознавая металлические стеллажи, картонные коробки, пластиковые контейнеры, бетонные полы, резиновые колёса или стеклянные панели, а не гоняясь за более красивым look-dev.

Субагент сенсоров создаёт устройства камеры и лидара заранее, чтобы размещение, поле зрения, дальность, частота опроса, перекрытия и видимость цели можно было проверить ещё до того, как сцена попадёт в симулятор. Затем субагент ovphysx делает мир физически осмысленным, добавляя коллизионные формы, массу, трение и поведение твёрдого тела, и превращает находки в план исправлений. Он генерирует простые коллизионные меши для статичного реквизита, помечает полы и полки как неподвижные коллайдеры, назначает свойства твёрдого тела предметам для захвата и помечает всё, что зависит от замысла задачи. Безопасные, механические исправления выполняются автоматически, а неоднозначные случаи — например, неуверенная семантическая метка или физическое поведение — передаются человеку с контекстом и предложенным следующим шагом. На выходе получается отчёт о готовности физики, который могут использовать последующие инструменты.