アトラックラボ、NVIDIA DGX Sparkで「オフライン対応フィジカルAI」を実現 〜建設現場などで自律制御ロボットのAI処理を完結〜

株式会社アトラックラボは、NVIDIAのコンパクトなパーソナルAIスーパーコンピューター「NVIDIA DGX Spark」上に、同社が開発したAI自律制御システム「AT-SYNAPSE」を稼働させるローカルLLM(大規模言語モデル)/VLM(視覚言語モデル)環境を構築し、動作検証を行いました。

これにより、映像や現場データを外部へ送信することなく、運用時にクラウドAIやインターネット接続に依存しない「オフライン対応フィジカルAI」が実現します。

開発の背景と課題解決

これまでの高性能AIの導入は、建設現場、山間部、地下施設、災害現場など、通信が不安定な場所や、映像・現場データを外部へ送信できない場所で多くの制約がありました。また、クラウドAIを利用する場合、通信の遅れ、サービス障害、継続的な費用といった課題も存在します。

アトラックラボは、これらの制約を解消するため、NVIDIA DGX Spark上でAT-SYNAPSEのLLM/VLMをローカルで実行する環境を構築しました。これにより、ロボットが取得したカメラ映像や深度情報をもとに、画像認識、周囲状況の理解、行動計画、推論、音声応答といったAI処理を現場内で完結できるようになります。

システム構成と機能

このシステムでは、NVIDIA DGX SparkがAT-SYNAPSEの「Brain on Desktop」として機能します。LLM/VLMの実行基盤にはOllamaを採用し、検証にはMoE(Mixture of Experts)方式の「Qwen3.6 35B-A3B」が使用されました。

ロボットとNVIDIA DGX SparkはROS 2およびMCP(Model Context Protocol)で接続され、ローカルLLM/VLMが以下の処理を行います。

  • ロボットのカメラ画像の取得

  • RGB画像と深度情報の統合理解

  • 画像内の物体や周囲状況の認識

  • 音声またはテキストによる指示の理解

  • 状況に応じた行動の計画・推論

  • ROS 2ツールの選択および呼び出し

  • ロボットへの移動・停止・ナビゲーション指示

  • 音声による応答

  • 認識内容、判断理由、実行結果のログ配信

処理内容は「AT-SYNAPSE Web Console」でリアルタイムに確認でき、ロボットが「何を見たのか」「どのように状況を理解したのか」「なぜその行動を選択したのか」をカメラ映像や機体状態とともに把握できます。

AI開発環境が整ったデスクの様子。NVIDIA DGX DashboardやJupyterLabが表示されたモニター、深度カメラ、AlienwareノートPCが並び、ロボット制御やデータ解析の画面が見える。

動作検証の結果と新機能

アトラックラボの検証環境における測定結果では、ロボットの計画・推論処理において毎秒64.3トークンの生成速度を記録しました。これにより、ローカル環境でも自然言語による対話や状況判断、ROS 2ツールの選択などを実用的な速度で処理できることが確認されています。

また、VLMによる対象物認識では、RealSenseカメラから取得した画像をQwen3.6 35B-A3Bに入力し、約4.5秒で画像内の対象物を検出・特定し、正しく回答しました。回答生成速度は毎秒約64トークンでした。画像全体の説明だけでなく、対象物の種類や位置を理解して回答できるため、ロボットによる探索や点検への応用が期待されます。

AT-SYNAPSEには、RealSenseカメラから取得するRGB画像とDepthフレームを統合的に理解する新機能が追加されました。これにより、映像に写る物体の種類だけでなく、対象物までの距離や位置関係も把握できるようになり、周囲の物体認識、障害物の特定、移動可能な空間の判断などが可能になります。

ローカルLLM/VLM実行の主なメリット

本環境でLLM/VLMをローカルで実行することには、以下のメリットがあります。

  • さまざまな現場で、ロボットが考え続けられる: カメラ映像や深度情報などをローカルで処理するため、データを外部へ送信することが難しい工場や研究施設、インフラ設備などでもLLM/VLMを利用できます。

  • 通信が不安定な場所でも、AIが動き続ける: モデルをあらかじめ導入すれば、インターネット接続が利用できない、または不安定な山間部や地下施設、災害現場でもロボットの認識・判断機能を継続できます。

  • 現場の稼働が、外部サービスに左右されにくい: 推論処理をローカルで実行するため、クラウドAIサービスの障害や利用制限によるロボットの動作停止リスクを軽減します。

  • 現場に必要な応答性能を設計しやすい: 映像やセンサーデータを外部サーバーと送受信しないため、外部通信回線の混雑や遅延による影響を抑え、必要な応答時間を事前に検証しやすくなります。

  • AIの利用量が増えても、APIコストを予測しやすい: 推論処理を自社環境で実行することで、クラウドAIの利用量に応じたAPI費用を抑え、運用コストを見通しやすくなります。

  • 用途に合ったオープンモデルを柔軟に選べる: Ollamaを利用することで、複数のオープンLLM/VLMを切り替えて利用でき、特定のクラウドAIや単一モデルに固定されず、新しいモデルの評価・導入も容易です。

NVIDIA DGX Sparkの活用と想定分野

NVIDIA DGX Sparkは、CPUとGPUを統合した「NVIDIA GB10 Grace Blackwell Superchip」と128GBのユニファイドメモリを搭載したコンパクトなAIコンピューターです。これをロボットの頭脳として活用することで、ロボット本体に大型のGPUコンピューターを搭載することなく、大規模なLLM/VLMを利用できます。これにより、ロボット本体の重量、消費電力、搭載スペースを抑えながら、高度な画像認識や推論処理を現場の近くで実行できるようになります。

この技術は、以下のような分野での活用が想定されています。

  • 建設現場やインフラ設備の点検ロボット

  • 災害現場や危険区域へ進入する調査ロボット

  • 機密情報を扱う研究施設内のロボット

  • 工場や物流倉庫内の搬送・巡回ロボット

  • 農業・林業向けフィールドロボット

  • 医療施設や公共施設の案内・巡回ロボット

  • 通信環境が限定される地域で稼働するUAV(ドローン)、UGV(無人車両)、USV(無人船舶)

  • ローカルLLM/VLMを利用したロボット研究・教育

その他のオープンソースシステム検証と今後の展開

アトラックラボは、NVIDIA DGX SparkをAT-SYNAPSEだけでなく、ローカルAIの共通基盤としても活用する検証を進めています。ローカルAIアシスタント環境としてOpen WebUIを導入し、Qwen3.6 35B-A3Bが良好に動作することを確認しました。また、画像・テキスト・動画を生成するワークフロー環境としてComfyUIの動作検証も進めています。

今後は、オープンLLM/VLMの量子化方式や推論速度などの比較検証を進め、RGB画像とDepth情報を活用した対象物までの距離推定、物体探索、障害物回避、移動計画など、認識結果を実際のロボット行動へ結び付ける機能を強化する予定です。同社開発のフィールドロボット「AT-CART8」をはじめ、ドローン、無人車両、無人船舶へ順次展開し、クラウドAIやインターネット接続に依存しないローカルフィジカルAIの社会実装を進めていくとしています。

AT-SYNAPSEと株式会社アトラックラボについて

AT-SYNAPSEは、大規模言語モデルをロボットの「頭脳」として活用する、アトラックラボ独自のAI自律制御システムです。MCP接続に対応したLLMエージェントとROS 2を統合し、音声やテキストの指示に基づいて、カメラ画像やセンサー情報を認識し、ロボットの行動を判断します。画像認識、音声対話、移動制御、自律ナビゲーション、障害物検知などの機能を備え、ロボットの認識内容や判断理由を「AT-SYNAPSE Web Console」でリアルタイムに確認できます。

株式会社アトラックラボは、ドローン、無人車両、無人船舶といったフィールドロボットにAIを組み合わせ、危険な仕事や不快な仕事から人々を解放することを目指すフィールドロボットSIerです。ROS 2やArduPilotなどのオープンソース技術を積極的に活用し、AI、ロボティクス、通信、GISを統合したシステムの設計・開発、PoC構築を行っています。

※本リリースにおける「オフライン対応」とは、モデル導入後の通常運用時に、外部のクラウドAIサービスやインターネット接続を必要とせず、ローカル環境内でAI推論を実行できることを指します。モデルの初回導入、更新、追加ダウンロードなどには、インターネット接続が必要となる場合があります。

×