1774716531
2026-03-28 15:54:00
まとめ
- 研究者のYuhang Hu氏が率いるAheadForm社は、高度な表情システムを搭載したバイオニック・ヒューマノイド・ロボット、Origin F1を発表した。
- このシステムは、人工皮膚と、リアルタイムの人工知能アルゴリズムによって制御されるマイクロアクチュエーターのネットワークに基づいています。
- このロボットには自己教師あり学習機能があり、音声に合わせて口パクしたり、環境内の視覚刺激に反応したりすることができます。
- このテクノロジーは、非言語コミュニケーションを改善し、「不気味の谷」現象(現実的ではあるが完全に人間ではない物体に対する嫌悪感)を軽減することに重点を置いています。
- ギリシャ市場の場合、これらのシステムのアプリケーションは主にロボット サービスやヘルスケアなどの B2B 環境に配置され、現地言語モデルの統合が基本要件となります。
人型ロボットのエンジニアリングは伝統的に運動学とバランスに焦点を当てており、機械のインタラクティブな側面は二の次となってきました。
または アヘッドフォームは、コロンビア大学クリエイティブ・マシン・ラボの長年の研究者であるユハン・フー氏の技術的指導の下、 バイオニック・ヒューマノイド・ロボット: Origin F1。この特定のモデルは、非常に複雑な生体工学的な顔を通じた非言語コミュニケーションの問題の解決にのみ焦点を当てています。
プレゼンテーションのビデオは、 オリジンF1 目を瞬きさせ、空間の動きを追跡し、微表情を動的に変更します。このシステムは、プログラムされた静的な反応ではなく、顔面モーターに供給される環境データの継続的な処理に基づいています。
Origin F1 と非言語コミュニケーションのアーキテクチャ
の オリジンF1 バイオニックヒューマノイドです ロボット 彼女 アヘッドフォーム 人工知能、人工皮膚の下のマイクロアクチュエーター、マシンビジョンシステムを組み込んでいます。これは、リアルな顔の表情を生成し、リアルタイムでアイコンタクトを維持することで、ロボットのインタラクションの問題に答え、人間と機械の間の非言語コミュニケーションのギャップを橋渡しします。
基本的な技術データ
- 自由度 (DoF) の数: 顔と首には 26 以上の独立した動き軸があります。
- コーティング材料: 人間の皮膚の弾力性を模倣した高度な分子構造の柔軟なシリコーン。
- センサー: 瞳孔の後ろに高解像度カメラを配置し、正確な視線追跡を実現します。
- 学習モデル: 変分オートエンコーダー (VAE) とフェイシャル アクション トランスフォーマーを組み合わせたもの。
顔面力学と主観的な物質的挙動
人間の脳を納得させる顔を構築するには、弾性素材と硬い機械部品の組み合わせが必要です。で オリジンF1、マイクロアクチュエーターは金属/ポリマーフレームに収容され、高強度ケーブルを介して合成皮革に接続されています。この特別なアプローチにより、唇、眉毛、頬骨の制御が可能になります。
動作中、ロボットは明確な機械的アイデンティティを維持します。モーターの密度が高いため、ヘッドの重量が増加します。完全な静寂の中で、まぶたの素早い開閉などの突然の動作により、知覚できない高周波音が発生します。さらに、これらの機構の継続的な動作には熱放散が必要です。これは、長時間の相互作用中に人工皮膚の後ろにある頭蓋骨の領域が測定可能な温度を上昇させることを意味します。シリコーンの質感は、視覚的には非常に現実的ですが、ポリマーの典型的な接触抵抗を保持しており、実際の人間の接触から体験を分離します。
人工知能の統合
その方法は、 オリジンF1 動き方を学習することは、従来のハードコーディング方法とは異なります。 Yuhang Hu の以前の研究によると、これらのシステムのトレーニングは「」に基づいています。ビジュアルセルフモデリング»。ロボットはまず鏡の前に配置されるか、カメラを使用して自分の顔を追跡します。モーターの何千ものランダムな動きを生成することで、機械的なコマンドと視覚的な出力を一致させるようにニューラル ネットワークを訓練します。
この特別な自己教師あり学習方法により、ロボットは、たとえば、対話者から録音したばかりの笑顔を再現するためにモーターを動かす方法を自分で認識することができます。 VAE モデル (変分オートエンコーダ) は音声を分析し、口パクのための正しい軌跡を自動的に抽出し、対話をフィードする ChatGPT や Gemini などの大規模言語モデル (LLM) と同期させます。
オーディオビジュアル同期の課題
ロボットの有効性はタイミングに大きく左右されます。研究によると、顔の模倣が遅れると、不誠実または機械的であると認識されることがわかっています。彼のシステム オリジンF1 人間の顔の筋肉の微小な動きを分析することで対話者の表情を予測し、同時に自身の表情を表現しようとします。それ間の相乗効果 フェイシャルアクショントランスフォーマー 自然言語処理アルゴリズムは、対話のスムーズな流れの基礎となります。
音声に正確な動きが必要な場合(例、唇を閉じる子音)、スピーカーからの音の再生とシリコーンの機械的応答の間の遅延は 200 ミリ秒未満に維持する必要があります。この厳格な制限には、クラウド インフラストラクチャに独占的に依存するのではなく、強力なローカル プロセッサが必要です。
テックギア提供
彼のプレゼンテーション オリジンF1 からの アヘッドフォーム ロボット産業が純粋な人間工学から心理的統合へ移行していることを浮き彫りにしています。 LLM アルゴリズムは、機械に音声を伝える機能も提供しましたが、身体言語や顔言語が伴わないため、その有用性は単純なコマンド処理に限られていました。
Yuhang Hu は、自律的な口パクと微表情の自己教師あり学習が技術的に実現可能であることを実証しました。材料上の制限 (合成皮膚の強度や熱損失など) は依然として残っていますが、ロボットツールからロボットトーカーへの移行は、理論的な問題ではなく、機械的な問題となっています。
#バイオニックヒューマノイドロボット #Origin