Використання ШІ-агентів для підготовки 3D-сцен до симуляції
Public- 17 Sep, 2026

Інженери з симуляції робототехніки постійно впираються в одне й те саме вузьке місце, і воно майже не пов'язане з політиками, моделями чи циклами навчання. Найскладніше часто починається ще до того, як щось навчається: у робота досі немає готового до симуляції світу, в якому можна тренуватися. Довести 3D-сцену з файлу Blender до стану, придатного для симулятора, — робота нудна, одноманітна й легка щодо помилок, і вона часто виходить за межі обов'язків інженера з симуляції. Саме в цій підготовчій роботі й можуть допомогти агентні системи, якщо в них є потрібні інструменти.
Описаний тут робочий процес пов'язує міркування, виконання інструментів і перевірку в єдиний повторюваний процес. Codex на базі OpenAI GPT-6 Astra виступає оркестратором, який ставить мету, інтерпретує результати й спрямовує ітерації. Спеціалізовані субагенти, зібрані на каркасі Hermes agent і розгорнуті через NVIDIA NemoClaw, викликають NVIDIA Omniverse Libraries, щоб оглянути сцену, сформувати метадані симуляції, налаштувати фізику й відрендерити візуальні передперегляди. Стек відштовхується від конкретної мети: на вході сцена Blender, мета — світ, готовий до робототехніки, на виході — сцена на базі USD, готова до симуляції, місце призначення — Isaac Sim або Isaac Lab, а перевірка поєднує візуальний передперегляд із перевірками SimReady.
Перший субагент підключається до Blender через сервер Model Context Protocol (MCP) і описує сцену, а не вгадує за скриншотами. Він може викликати інструменти для огляду об'єктів, колекцій, трансформацій, матеріалів, камер, джерел світла та метаданих сцени, повертаючи структурований опис, який стає спільним контекстом для решти агентів. У прикладі результату налічується 142 об'єкти та 37 матеріалів, а заодно позначається відсутність семантичних міток, колізійних мешів, сенсорів камери та фізичних матеріалів. Astra використовує цей опис разом із задачею робототехніки, щоб виявити брак інформації, спланувати наступні задачі та передати їх із чіткими критеріями приймання.


Далі опис переходить до спеціалізованих агентів, які вже впливають на сцену. Агент авторингу USD зберігає ієрархію, трансформації, матеріали, мітки, фізичні метадані та визначення сенсорів, спираючись на шарувату, неруйнівну композицію USD, щоб агенти могли збагачувати світ, не сплощуючи вихідний арт. Агент семантичної розмітки перетворює безіменні меші на об'єкти, осмислені для задачі, — полиці, контейнери, підлоги, перешкоди, предмети для захоплення та цілі робота, — виводячи мітки з імен, ієрархії, форми та контексту й позначаючи невизначене. У демо виявилися розміченими 118 примів, а 9 міток залишено на перевірку людиною. Агент матеріалів переводить візуальний вигляд у корисні для симуляції метадані, розпізнаючи металеві стелажі, картонні коробки, пластикові контейнери, бетонні підлоги, гумові колеса чи скляні панелі, а не женучись за красивішим look-dev.

Субагент сенсорів створює пристрої камери та лідара заздалегідь, щоб розміщення, поле зору, дальність, частота опитування, перекриття та видимість цілі можна було перевірити ще до того, як сцена потрапить у симулятор. Потім субагент ovphysx робить світ фізично осмисленим, додаючи колізійні форми, масу, тертя та поведінку твердого тіла, і перетворює знахідки на план виправлень. Він генерує прості колізійні меші для статичного реквізиту, позначає підлоги та полиці як нерухомі колайдери, призначає властивості твердого тіла предметам для захоплення та позначає все, що залежить від задуму задачі. Безпечні, механічні виправлення виконуються автоматично, а неоднозначні випадки — наприклад, невпевнена семантична мітка або фізична поведінка — передаються людині з контекстом і запропонованим наступним кроком. На виході отримуємо звіт про готовність фізики, який можуть використовувати наступні інструменти.