1715451237
2024-05-10 15:00:00
AI モデルが指示なしに欺瞞的に動作する可能性があるという事実は、懸念されるかもしれません。 しかし、それは主に、最先端の機械学習モデルの特徴である「ブラック ボックス」問題から生じています。つまり、モデルがどのように、なぜそのような結果を生み出すのか、あるいはモデルが常にそのような動作を示すのかどうかを正確に言うことは不可能です。このプロジェクトに携わった MIT で AI の実存安全性を研究している博士研究員ピーター S. パーク氏は、今後の展開について次のように述べています。
「テスト環境で AI が特定の動作や傾向を示したからといって、それが実際に公開されたときに同じ教訓が当てはまるとは限りません」と彼は言います。 「これを解決する簡単な方法はありません。AI が実際に導入された後にどのような動作をするかを知りたければ、AI を実際に導入するだけです。」
AI モデルを擬人化する傾向は、これらのシステムをテストする方法やその機能についての考え方に影響を与えます。 結局のところ、人間の創造性を測定するために設計されたテストに合格したからといって、AI モデルが実際に創造的であることを意味するわけではありません。 ケンブリッジ大学の AI 研究者ハリー・ロー氏は、規制当局や AI 企業が、そのテクノロジーが害を及ぼす可能性と、社会にもたらす潜在的な利益を慎重に比較検討し、そのモデルでできることとできないことを明確に区別することが重要であると述べています。 「これらは本当に難しい質問です」と彼は言います。
基本的に、あらゆる状況において欺瞞ができない AI モデルをトレーニングすることは現時点では不可能である、と彼は言います。 また、欺瞞的な動作の可能性は、偏見や誤った情報を増幅する傾向と並んで、AI モデルを現実世界のタスクで信頼する前に対処する必要がある多くの問題の 1 つです。
「これは、欺瞞が可能であることを示す良い研究です」とロー氏は言う。 「次のステップは、リスクプロファイルがどのようなものか、そして欺瞞的な行為から潜在的に生じる可能性のある危害がどのくらいの確率でどのような形で発生するのかを解明するために、もう少し踏み込むことです。」
#システムは私たちを騙すのが上手になっています