日本語版
最新ニュース
世界

言語モデルはリスクや有害な反応を引き起こす、専門家が警告

OpenAI の ChatGPT が自動テキスト生成のあり方を変え続けているため、研究者らは危険な応答を回避するためにさらなる対策が必要であると警告しています。 ChatGPTなどの高度な言語モデルは、複雑なコードを含むコンピュータープログラムを迅速に記述したり、説得力のある概要で研究を要約したりできるが、専門家は、これらのテキストジェネレーターは爆弾の作り方などの有害な情報も提供できると述べている。 これらの潜在的な安全性の問題を防ぐために、大規模な言語モデルを使用している企業は「レッドチーム」と呼ばれる安全策を導入しています。これは、人間のテスターのチームが、リスクを追跡し、そのようなタイプの提供を回避するようにチャットボットをトレーニングするために、危険な応答を引き起こすことを目的としたプロンプトを作成します。の答え。 しかし、マサチューセッツ工科大学(MIT)の研究者らによると、「レッドチーム」は、どの挑発的な反応をテストすべきかをエンジニアが知っている場合にのみ効果的だという。 言い換えれば、人間の認知に依存せずに機能するテクノロジーであっても、安全性を保つためには依然として人間の認知に依存しているということです。 MIT の Improbable AI Lab と MIT-IBM Watson AI Lab の研究者たちは、この問題を解決するために機械学習を導入し、テスト済みのチャットボットから望ましくない応答を引き起こす問題のあるプロンプトを生成するように特別に設計された「レッドチーム言語モデル」を開発しています。 「現時点では、すべての大規模な言語モデルは、安全性を確保するために非常に長期間のレッドチームを経る必要があります」と、Improbable AI lab の研究者であり、このレッドチームアプローチに関する論文の筆頭著者である Zhang-Wei Hon 氏は述べています。 、プレスリリースで。 「急速に変化する環境でこれらのモデルを更新したい場合、それは持続可能ではありません。 私たちの方法は、この品質保証をより迅速かつ効果的に行う方法を提供します。」 研究によると、この機械学習技術は、高度な言語モデルからますます有毒な応答を引き起こすプロンプトを生成し、安全装置が組み込まれたチャットボットから危険な応答を引き出すことによって、人間のテスターよりも優れたパフォーマンスを示しました。 AI のレッドチーム化 MITの研究者らによると、言語モデルをレッドチーム化する自動プロセスは、有害な反応を引き起こすモデルに報酬を与える試行錯誤のプロセスに依存しているという。 この報酬システムは、いわゆる「好奇心主導の探索」に基づいており、レッドチーム モデルは、さまざまな単語、文パターン、またはコンテンツを使用して敏感なプロンプトを展開し、有害性の限界に到達しようとします。 「レッドチーム モデルが特定のプロンプトをすでに認識している場合、それを再現してもレッドチーム モデルに好奇心は生じないため、新しいプロンプトの作成が促されることになります」とホン氏はリリースの中で説明した。…

言語モデルはリスクや有害な反応を引き起こす、専門家が警告

1713744454
2024-04-21 21:20:00

OpenAI の ChatGPT が自動テキスト生成のあり方を変え続けているため、研究者らは危険な応答を回避するためにさらなる対策が必要であると警告しています。

ChatGPTなどの高度な言語モデルは、複雑なコードを含むコンピュータープログラムを迅速に記述したり、説得力のある概要で研究を要約したりできるが、専門家は、これらのテキストジェネレーターは爆弾の作り方などの有害な情報も提供できると述べている。

これらの潜在的な安全性の問題を防ぐために、大規模な言語モデルを使用している企業は「レッドチーム」と呼ばれる安全策を導入しています。これは、人間のテスターのチームが、リスクを追跡し、そのようなタイプの提供を回避するようにチャットボットをトレーニングするために、危険な応答を引き起こすことを目的としたプロンプトを作成します。の答え。

しかし、マサチューセッツ工科大学(MIT)の研究者らによると、「レッドチーム」は、どの挑発的な反応をテストすべきかをエンジニアが知っている場合にのみ効果的だという。

言い換えれば、人間の認知に依存せずに機能するテクノロジーであっても、安全性を保つためには依然として人間の認知に依存しているということです。

MIT の Improbable AI Lab と MIT-IBM Watson AI Lab の研究者たちは、この問題を解決するために機械学習を導入し、テスト済みのチャットボットから望ましくない応答を引き起こす問題のあるプロンプトを生成するように特別に設計された「レッドチーム言語モデル」を開発しています。

「現時点では、すべての大規模な言語モデルは、安全性を確保するために非常に長期間のレッドチームを経る必要があります」と、Improbable AI lab の研究者であり、このレッドチームアプローチに関する論文の筆頭著者である Zhang-Wei Hon 氏は述べています。 、プレスリリースで。

「急速に変化する環境でこれらのモデルを更新したい場合、それは持続可能ではありません。 私たちの方法は、この品質保証をより迅速かつ効果的に行う方法を提供します。」

研究によると、この機械学習技術は、高度な言語モデルからますます有毒な応答を引き起こすプロンプトを生成し、安全装置が組み込まれたチャットボットから危険な応答を引き出すことによって、人間のテスターよりも優れたパフォーマンスを示しました。

AI のレッドチーム化

MITの研究者らによると、言語モデルをレッドチーム化する自動プロセスは、有害な反応を引き起こすモデルに報酬を与える試行錯誤のプロセスに依存しているという。

この報酬システムは、いわゆる「好奇心主導の探索」に基づいており、レッドチーム モデルは、さまざまな単語、文パターン、またはコンテンツを使用して敏感なプロンプトを展開し、有害性の限界に到達しようとします。

「レッドチーム モデルが特定のプロンプトをすでに認識している場合、それを再現してもレッドチーム モデルに好奇心は生じないため、新しいプロンプトの作成が促されることになります」とホン氏はリリースの中で説明した。

この技術は、より有害な反応を誘発するより明確なプロンプトを生成することで、人間のテスターや他の機械学習アプローチよりも優れた性能を発揮しました。 彼らの方法は、他の自動化された方法と比較して、テスト対象の入力範囲を大幅に改善するだけでなく、人間の専門家によって安全装置が組み込まれたチャットボットから有害な反応を引き出すこともできます。

このモデルには、誘発される毒性のレベルをランク付けする「安全性分類機能」が装備されています。

MITの研究者らは、レッドチームモデルをトレーニングして、より広範囲の引き出しコンテンツに関するプロンプトを生成し、最終的には出力の自動化が進む中で企業ポリシー違反をテストするために、企業ポリシー文書などの特定の基準に従うようにチャットボットをトレーニングしたいと考えている。 。

「これらのモデルは私たちの生活に不可欠な部分になるため、一般向けにリリースされる前に検証されることが重要です」と、Improbable AI の上級著者兼ディレクターであるプルキット・アグラワル氏はリリースの中で述べています。

「モデルの手動検証は単純に拡張性がありません。私たちの取り組みは、より安全で信頼できる AI の未来を確保するために人間の労力を削減する試みです」とアグラワル氏は述べています。

#言語モデルはリスクや有害な反応を引き起こす専門家が警告

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。