1729938883
2024-10-26 06:50:00
テクノロジー大手の OpenAI は、人工知能を活用した文字起こしツール Whisper が「人間レベルの堅牢性と正確さ」に近いと宣伝しています。
しかし、Whisper には大きな欠陥があります。十数人のソフトウェア エンジニア、開発者、学術研究者へのインタビューによると、Whisper はテキストの塊、さらには文章全体を構成する傾向があるということです。
これらの専門家らは、業界では幻覚として知られる創作テキストの一部には、人種的解説や暴力的なレトリック、さらには想像上の医療行為さえも含まれる可能性があると述べた。
専門家らは、Whisper は世界中の多くの業界でインタビューの翻訳や文字起こし、一般的な消費者向け技術でのテキスト生成、ビデオの字幕作成などに使用されているため、こうした捏造には問題があると述べた。
コーネル大学情報科学助教授 Allison Koenecke (Seth Wenig/AP)
さらに懸念されるのは、このツールを「高リスク領域」で使用すべきではないとのOpenAIの警告にもかかわらず、医療センターが医師との患者の診察を文字に起こすためにWhisperベースのツールを急いで利用していることだという。
問題の全容を特定するのは難しいが、研究者や技術者らは、仕事中にウィスパーの幻覚に頻繁に遭遇したと述べた。
たとえば、公開会議の研究を行っているミシガン大学の研究者は、モデルの改良を始める前に、検査した音声転写10件中8件で幻覚を発見したと述べた。
ある機械学習エンジニアは、最初に分析した100時間以上のWhisperの文字起こしのうち約半分で幻覚を発見したと述べた。
3人目の開発者は、Whisperで作成した2万6000件のトランスクリプトのほぼすべてに幻覚を発見したと述べた。
この問題は、十分に録音された短いオーディオ サンプルでも依然として発生します。コンピュータ科学者らによる最近の研究では、調査した13,000以上の明瞭な音声断片から187件の幻覚が発見されました。
研究者らによると、この傾向により、数百万件の録音で数万件の誤った転写が発生する可能性があるという。
昨年までバイデン政権でホワイトハウス科学技術政策局を率いていたアロンドラ・ネルソン氏は、こうした間違いは特に病院の現場で「非常に重大な結果」をもたらす可能性があると述べた。
このような幻覚の蔓延を受けて、専門家、擁護者、元OpenAI従業員らは連邦政府にAI規制を検討するよう求めている。少なくとも、OpenAI はこの欠陥に対処する必要がある、と彼らは述べた。
OpenAIの広報担当者は、同社は幻覚を軽減する方法を継続的に研究しており、研究者の発見を高く評価していると述べ、OpenAIはモデルの更新にフィードバックを組み込んでいると付け加えた。
ほとんどの開発者は、文字起こしツールは単語のスペルを間違えたり、その他のエラーを起こすと想定していますが、エンジニアや研究者らは、AI を活用した文字起こしツールが Whisper ほど幻覚を起こすのを見たことがないと述べています。
コーネル大学のアリソン・コーネッケ教授とバージニア大学のモナ・スローン教授は、カーネギーメロン大学がホストする研究リポジトリであるトークバンクから入手した何千もの短い断片を調べた。
彼らは、幻覚のほぼ 40% は、話者が誤解されたり、誤って伝えられたりする可能性があるため、有害または懸念すべきものであると判断しました。
彼らが明らかにした例では、話者は「彼、少年は、正確にはわかりませんが、傘を持とうとしていました。」と述べました。
しかし、転写ソフトウェアはさらに次のように付け加えた。「彼は大きな十字架のかけらも、小さな小さな十字架のかけらも持っていった…きっと恐怖のナイフを持っていなかったので、何人もの人を殺したのだろう。」
別の録音の話者は「他に2人の女の子と1人の女性」と説明した。
ウィスパーは人種に関する追加の解説をでっち上げ、「あと2人の女の子と1人の女性、えーっと、黒人でした」と付け加えた。
#AIを活用した文字起こしツールが余分な文章を幻覚させることが判明