1770065695
2026-02-02 20:28:00
研究者たちは、新しいマルチモーダル ベンチマーク データセットである InspecSafe-V1 の導入により、ますます自動化が進む産業検査シナリオにおける安全性を確保するという重要な課題に取り組んでいます。清華大学のZeyi Liu、Shuang Liu、Pengyu Han、そしてJihai Min、Zhaoheng Zhang、Jun Cenら。 TetraBOT Intelligence Co., Ltd. と Alibaba Group の DAMO Academy は、シミュレートされたデータに依存したり、詳細な注釈が欠けたりすることが多い既存のデータセットの制限に対処するために、このリソースを作成しました。 InspecSafe-V1 は、2,239 の現場にわたる 40 台以上の検査ロボットから収集された現実世界のデータを利用することで優れており、ピクセル レベルのセグメンテーションと、赤外線、音声、レーダーを含む 7 つの同期センシング モダリティを提供して、産業基盤モデルの堅牢な現場の理解と包括的な安全性評価を促進します。このデータセットは、複雑な産業環境における予知保全と真の自律的検査に不可欠な信頼性の高い認識システムの開発を大幅に前進させることを約束します。
この画期的な取り組みは、予知保全および自律検査システムを展開する際の主要なボトルネックである、複雑な産業環境における信頼性の高い認識に対する需要の高まりに対応します。研究チームは、2,239 の有効な検査現場にわたる 41 台の車輪付きおよびレール搭載検査ロボットの日常業務からデータを収集することによって InspecSafe-V1 を構築し、その結果、5,013 件の検査インスタンスの包括的な収集が得られました。重要な革新は、可視スペクトル画像内の主要なオブジェクトに対するピクセルレベルのセグメンテーション注釈と、詳細な意味論的シーンの説明および実際の検査タスクに合わせた対応する安全レベルラベルをデータセットが提供することにあります。
この研究では、赤外線ビデオ、音声、深度点群、レーダー点群、ガス測定、温度、湿度を含む 7 つの同期センシング方式を統合することにより、新しい標準を確立します。このマルチモーダルなアプローチは、高度な異常認識、クロスモーダル融合、および包括的な安全性評価をサポートし、従来の単一センサーの限界を超えています。研究者たちは、5 つの代表的な産業シナリオ、トンネル、発電施設、焼結装置、石油およびガス石油化学プラント、石炭コンベヤー架台からデータを細心の注意を払って収集し、幅広い適用性と堅牢性を確保しました。実際のロボットの検査中に収集された現実世界のデータを含めることで、シミュレートされた環境や限られたセンシング機能に依存することが多い既存のデータセットの欠点に直接対処できます。
実験では、オブジェクトレベルの詳細とシーンレベルの安全性評価の両方を含む InspecSafe-V1 の豊富な注釈スキームが、微妙な理解と推論が可能な AI システムの開発を促進することを実証しています。このデータセットの設計は、従来の AI モデルのパフォーマンスを妨げることが多い、高いノイズ レベル、深刻なオクルージョン、複雑な機器レイアウトなどの工業検査の課題を特にターゲットにしています。この取り組みは、再現可能な結果を備えた標準化されたベンチマークを提供することで、産業用 AI アルゴリズムの公正な比較と反復的な改善のための新たな道を開き、自律型検査ソリューションの展開を加速します。この進歩により、事後検知からプロアクティブな早期警報システムへと焦点が移り、重要な産業運営における安全性と効率性が向上することが期待されます。
ロボットによるデータ収集と安全性の注釈は重要です
科学者たちは、既存のシミュレートされたデータセットまたは単一モダリティのデータセットに見られる制限に対処する、産業検査の安全性評価を推進するために設計された新しいベンチマーク データセットである InspecSafe-V1 を発表しました。この研究では、41 台の車輪付きおよびレール搭載の検査ロボットを使用して、2,239 の有効な検査現場からデータを綿密に収集し、その結果、5,013 件の検査事例が得られました。各インスタンスには、可視スペクトル画像内の主要なオブジェクトに対するピクセル レベルのセグメンテーション アノテーションと、実際の検査タスクに合わせた意味論的なシーンの説明および安全レベルのラベルが付いています。この包括的なアノテーション戦略により、産業基盤モデルの堅牢なシーンの理解と安全性の推論が容易になります。
検査プラットフォームには、データ収集プロセスの中心となるマルチモーダル認識システムが組み込まれています。 3D LiDAR センサーと並んで前向きの RGB カメラと深度カメラは、視覚的な外観、空間ジオメトリ、プラットフォームの姿勢をキャプチャし、マルチモーダル データの時間的同期と空間的位置合わせを可能にします。 RGB カメラと同じ場所に設置された熱赤外線カメラは、表面温度分布を監視して過熱や熱異常を検出し、水平視野 53.7°、垂直視野 39.7°で 25 FPS で動作します。ミリ波レーダーは LiDAR を補完し、粉塵や低照度などの厳しい条件下での堅牢性を強化し、音響センサーは機械のノイズや異常な信号を記録します。
シナリオ固有のニーズに基づいて構成されたガス センサーは、カスタマイズ可能な範囲と周波数を利用して、可燃性ガスまたは有毒ガス、または環境の安全性を監視します。 RGB カメラは 55.8° ~ 2.3° の水平視野を持つ 1/2.8 インチ CMOS センサーを採用し、TM265-E1 深度カメラは 0.05m ~ 5m までの効果的な測定を提供します。 MID360 LiDAR は、最大検出範囲が 10% の反射率で 40m、80% の反射率で 70m で、幾何学的認識をさらに強化します。車輪付きプラットフォームとレール搭載プラットフォームの間でセンサーの設定が異なるにもかかわらず、この詳細なマルチモーダル アプローチにより、包括的な異常認識とクロスモーダルの融合が可能になり、産業安全性評価が向上します。
ロボット検査の安全性を実現する InspecSafe-V1 マルチモーダル データセットが提供する
科学者らは、産業検査の安全性評価のために設計された新しいベンチマーク データセットである InspecSafe-V1 をリリースしました。このデータセットは、2,239 の有効な検査現場における 41 台の検査ロボットの日常業務から収集されました。この調査では 5,013 件の検査インスタンスが得られ、それぞれの検査インスタンスには、意味論的なシーンの説明と安全レベルのラベルとともに、可視スペクトル画像内の主要なオブジェクトのピクセルレベルのセグメンテーションで細心の注意を払って注釈が付けられました。赤外線ビデオ、音声、深度点群、レーダー点群、ガス測定、温度、湿度を含む 7 つの同期センシング モダリティが統合され、異常認識と安全性評価のための包括的なデータ ソースが提供されます。実験では、視覚的な注釈やマルチモーダルな感覚データへの効率的なアクセスを促進するために、注釈、その他のモダリティ、パラメーターで構成される詳細なディレクトリ構造を備えた堅牢なデータセットの構築に焦点を当てました。
Annotations ディレクトリには通常データと異常データの両方が含まれており、RGB ビデオからサンプリングされた代表的なキーフレームが、きめ細かいオブジェクト レベルの注釈を詳細に記述した対応する JSON ファイルと、シーン レベルのセマンティックな説明を提供するプレーン テキスト ファイルとともに保存されます。 Other modalities ディレクトリには、RGB、サーマル ビデオ、3D 点群、音響信号、環境センシング データなどの同期データが、すべて互換性のために広く使用されている形式で保存されます。データ分析の結果、ロボット モデル間で検査ポイントの分布に顕著な不均衡があり、レール搭載プラットフォーム T3 C05 と T3 S05 がそれぞれ 39.1% と 24.9% を占め、全検査ポイントの合計 64.0% を占めていることが明らかになりました。研究者らは、RGB モダリティ内で 234 のオブジェクト カテゴリを定義しました。これは、顕著なロングテール分布を示しており、パイプライン (12.9%)、トラフィック コーン (8.9%)、およびステント (7.1%) が最も頻度の高いカテゴリであり、合計で全オブジェクトの 39.3% を占めています。
データセットには、トンネル、電力施設、焼結装置、石油およびガス石油化学プラント、石炭コンベヤー トレッスルという 5 つの産業シナリオが含まれており、正常サンプルと異常サンプルの比率は、トンネル シーンの正常 78.2% / 異常 21.8% から、石油およびガス環境の正常 65.1% / 異常 34.9% まで、さまざまです。データ品質を確保するために、厳密な 2 ラウンドの独立した検証プロセスがすべてのピクセルレベルのアノテーションに適用され、最終的なデータセットに含めるには両方のラウンドで 95% を超える精度が必要でした。セマンティック アノテーションも同様の検証プロセスを受け、シーンの説明の正確さ、安全レベルの関連性、および危険の説明の完全性が評価され、存在する最も深刻な危険によって全体の安全レベルが決定されました。この細心の注意を払ったアプローチにより、すべてのプラットフォームにわたるコア監視信号の一貫性と正確性が保証され、産業検査や予知保全の研究を進めるための高品質のリソースが提供されます。
産業安全のための実世界のマルチモーダルデータはますます増えています
研究者らは、現場の理解と安全推論の向上を通じて産業検査の安全性評価を前進させるように設計された新しいベンチマーク データセットである InspecSafe-V1 を導入しました。このデータセットは、シミュレートされたデータや単一のセンシングモダリティに依存することが多い、または詳細なオブジェクトレベルの注釈が欠如している既存のリソースの現在の制限に対処します。 InspecSafe-V1 は、2,239 の現場で 41 台の検査ロボットを使用して実際の産業環境から収集されたデータで構成されており、その結果、ピクセル レベルのセグメンテーションと安全レベルのラベルを備えた 5,013 の検査インスタンスが得られます。このデータセットには、7 つの同期センシング モダリティ、可視スペクトル画像、赤外線ビデオ、音声、深度およびレーダー点群、ガス測定、温度、湿度が組み込まれており、包括的な異常認識とクロスモーダル データの融合が可能になります。
👉 詳細情報
🗞 InspecSafe-V1: 産業検査シナリオにおける安全性評価のためのマルチモーダル ベンチマーク
🧠ArXiv:
#InspecsafeV1 #は実世界のデータと #つのシナリオで産業検査の安全性を向上させます