1730086196
2024-10-28 02:13:00
テクノロジー大手の OpenAI は、人工知能を利用した文字起こしツール Whisper が「人間レベルの堅牢性と正確さ」に近いと宣伝しています。
しかし、Whisper には大きな欠陥があります。十数人のソフトウェア エンジニア、開発者、学術研究者へのインタビューによると、Whisper はテキストの塊、さらには文章全体を構成する傾向があるということです。
これらの専門家らは、創作された文章の一部(業界では幻覚として知られている)には、人種的解説や暴力的なレトリック、想像上の治療法さえも含まれる可能性があると述べた。
専門家らは、Whisper は世界中の多くの業界でインタビューの翻訳や文字起こし、一般的な消費者向け技術でのテキスト生成、ビデオの字幕作成などに使用されているため、こうした捏造には問題があると述べた。
さらに懸念されるのは、このツールを「高リスク領域」で使用すべきではないとのOpenAIの警告にもかかわらず、医療センターが医師との患者の診察を文字に起こすためにWhisperベースのツールの利用を急いでいることだという。
問題の全容を特定するのは難しいが、研究者や技術者らは、仕事中にウィスパーの幻覚に頻繁に遭遇したと述べた。
たとえば、公開会議の研究を行っているミシガン大学の研究者は、モデルの改善を試みる前に、検査した音声転写10件中8件で幻覚を発見したと述べた。
ある機械学習エンジニアは、最初に分析した100時間以上のWhisperの文字起こしのうち約半分で幻覚を発見したと述べた。
3人目の開発者は、Whisperで作成した2万6000件のトランスクリプトのほぼすべてに幻覚を発見したと述べた。
この問題は、十分に録音された短いオーディオ サンプルでも発生します。
コンピュータ科学者らによる最近の研究では、調査した13,000以上の明瞭な音声断片から187件の幻覚が発見されました。研究者らによると、この傾向により、数百万件の録音で数万件の誤った転写が発生する可能性があるという。
昨年までバイデン政権でホワイトハウス科学技術政策局を率いていたアロンドラ・ネルソン氏は、こうした間違いは特に病院の現場で「非常に重大な結果」をもたらす可能性があると述べた。
「誤診は誰も望んでいません」とニュージャージー州プリンストン高等研究所のネルソン教授は言う。 「もっと高いハードルがあるはずだ。」
Whisper は、聴覚障害者や難聴者、つまり文字起こしに失敗する特別なリスクにさらされている人々向けのクローズド キャプションの作成にも使用されます。
聴覚障害者であり、ギャローデット大学のテクノロジー・アクセス・プログラムを指揮するクリスチャン・フォーグラー氏は、聴覚障害者や聴覚障害者には「他の文書の中に隠された」捏造を特定する方法がないからだ、と語った。
OpenAIは問題への対処を求める
このような幻覚の蔓延を受けて、専門家、擁護者、元OpenAI従業員らは連邦政府にAI規制を検討するよう求めている。
少なくとも、OpenAI はこの欠陥に対処する必要がある、と彼らは述べた。
同社の方向性への懸念から2月にOpenAIを辞めた、サンフランシスコを拠点とする研究エンジニアのウィリアム・サンダース氏は、「会社がそれを優先するつもりであれば、この問題は解決可能だと思われる」と語った。
「これを世に出すと、人々がこれで何ができるか、他のすべてのシステムに統合できるかについて過信するようになるのは問題です。」
OpenAIの広報担当者は、同社は幻覚を軽減する方法を継続的に研究しており、研究者の発見を高く評価していると述べ、OpenAIはモデルの更新にフィードバックを組み込んでいると付け加えた。
ほとんどの開発者は、文字起こしツールは単語のスペルを間違えたり、その他のエラーを起こすと想定していますが、エンジニアや研究者らは、AI を活用した文字起こしツールが Whisper ほど幻覚を起こすのを見たことがないと述べています。
ささやき幻覚
このツールは、OpenAI の主力チャットボットである ChatGPT の一部のバージョンに統合されており、世界中の何千もの企業にサービスを提供している Oracle と Microsoft のクラウド コンピューティング プラットフォームに組み込まれています。
テキストを転記したり、複数の言語に翻訳したりするためにも使用されます。
先月だけで、Whisper の最新バージョンの 1 つが、オープンソース AI プラットフォーム HuggingFace から 420 万回以上ダウンロードされました。
同校の機械学習エンジニアであるサンチット・ガンジー氏によると、Whisperは最も人気のあるオープンソースの音声認識モデルで、コールセンターから音声アシスタントに至るまであらゆるものに組み込まれているという。
コーネル大学のアリソン・コーネッケ教授とバージニア大学のモナ・スローン教授は、カーネギーメロン大学がホストする研究リポジトリであるトークバンクから入手した何千もの短い断片を調べた。
彼らは、幻覚のほぼ 40% が、話者が誤解されたり、誤って伝えられたりする可能性があるため、有害または懸念すべきものであると判断しました。
彼らが明らかにした例では、話者は「彼、少年は、正確にはわかりませんが、傘を持とうとしていました。」と述べました。
しかし、転写ソフトウェアはさらに次のように付け加えた。「彼は大きな十字架のかけらも、小さな小さな十字架のかけらも持っていった…恐怖のナイフを持っていなかったはずだから、何人もの人を殺したのだろう。」
別の録音の話者は「他に2人の女の子と1人の女性」と説明した。ウィスパーは人種に関する特別な解説をでっちあげ、「あと2人の女の子と1人の女性、えーっと、黒人でした」と付け加えた。
3 番目の転写では、ウィスパーは「過剰活性化抗生物質」と呼ばれる存在しない薬を発明しました。
研究者らは、なぜWhisperや同様のツールが幻覚を起こすのかは分かっていないが、ソフトウェア開発者らは、捏造は一時停止中や背景音、音楽の再生中に起こる傾向があると述べた。
OpenAIはオンライン開示の中で、「精度の欠陥が結果の明らかな欠陥につながる可能性がある意思決定の場面」でWhisperを使用しないよう勧告した。
医師の予約を文字に起こす
この警告を受けても、病院や医療センターは、医療提供者がメモ取りやレポート作成に費やす時間を短縮するために、Whisper などの音声テキスト変換モデルを使用して医師の診察中に話された内容を文字に起こすことを止めていない。
3万人を超える臨床医と、ミネソタ州のマンケートクリニックやロサンゼルス小児病院を含む40の医療システムが、フランスと米国にオフィスを構えるNablaが構築したWhisperベースのツールの使用を開始した。

Nabla 社の最高技術責任者 Martin Raison 氏によると、このツールは患者のやり取りを文字に起こし、要約するために医療用語に合わせて微調整されているという。同社関係者らは、Whisperが幻覚を起こす可能性があることを認識しており、問題に取り組んでいると述べた。
Nablaのツールは「データ安全上の理由」からオリジナルの音声を消去するため、NablaのAIが生成したトランスクリプトを元の録音と比較することは不可能だとレゾン氏は述べた。
ナブラ氏は、このツールは推定700万件の医療訪問の記録に使用されていると述べた。
元OpenAIエンジニアのサンダース氏は、トランスクリプトが二重チェックされていないか、臨床医が録音にアクセスして正確であることを確認できない場合、元の音声を消去するのは心配になる可能性があると述べた。
「グラウンドトゥルースを取り去ってしまうと、エラーを見つけることはできません」と彼は言いました。
ナブラ氏は、完璧なモデルはなく、現在医療提供者は転写されたメモを迅速に編集して承認する必要があるが、状況は変わる可能性があると述べた。
プライバシーに関する懸念
医師との患者の面談は機密扱いであるため、AI が生成した記録が患者にどのような影響を与えているかを知るのは困難です。
バウアー=カーハン氏は、そのような親密な医療会話がテクノロジー企業と共有されることを望んでいなかったと彼女は語った。
州議会でサンフランシスコ郊外の一部を代表する民主党のバウアー・カハン氏は、「この発表は、営利企業がこれを取得する権利を有するという非常に具体的な内容だった」と述べた。 「私は『絶対にそんなことはない』と思っていました。」
ジョン・ミューア・ヘルスの広報担当ベン・ドリュー氏は、医療システムは州および連邦のプライバシー法を遵守していると述べた。
#米国の病院で使用されている #文字起こしツールが誰も言わなかった事柄を発明する