1727670193
2024-09-30 03:59:00
AI モデルによる捏造は止まらないようです。最近の 2 つの研究が指摘しているように、この傾向は、本当に重要なことについては AI のアドバイスに頼らないようにという事前の警告を裏付けています。
AI が頻繁に作成するものの 1 つは、ソフトウェア パッケージの名前です。
今年初めにお知らせしたように、Lasso Security は、大規模言語モデル (LLM) がサンプル ソース コードを生成する際に、ソフトウェア パッケージの依存関係の名前を作成する場合があることを発見しました。 存在しないもの。
これは恐ろしいことです。なぜなら、犯罪者は一般的な AI サービスによって生成された名前を使用したパッケージを簡単に作成し、そこにマルウェアを詰め込むことができるからです。その後、不運な開発者が、取り込まれた破損した依存関係を組み込んだ汚染されたパッケージを使用するという AI の提案を受け入れるのを待つだけです。
テキサス大学サンアントニオ校、オクラホマ大学、バージニア工科大学の研究者らは最近、コード生成に使用される 16 個の LLM を調査し、パッケージ名を構成する傾向を調査しました。
で プレプリント紙 「パッケージを用意しました! コード生成 LLM によるパッケージ幻覚の包括的分析」というタイトルで、著者らは幻覚が LLM の未解決の欠点の 1 つであると説明しています。
昨年、法的準備書面で存在しない裁判例を引用するために生成型 AI を使用し、その後、独自の裁判例を作成しなければならなかった弁護士たちも、おそらくそのことを忘れていないでしょう。 影響を受けた裁判所に謝罪する。しかし、LLM がコーディング支援に本当に役立つと考える人の間では、これは繰り返す価値のある点です。
著者のJoseph Spracklen氏、Raveen Wijewickrama氏、AHM Nazmussakib氏、Anindya Maiti氏、Bimal Viswanath氏、Murtuza Jadliwala氏によると、「幻覚とは、事実に誤りがあったり、意味がなかったり、入力タスクとはまったく関係のないLLMによって生成される出力である」という。 「幻覚は、不正確または誤解を招く情報を生成する可能性があるため、公共向けアプリケーションで LLM を効果的かつ安全に展開する上で重大な障害となります。」
おそらく「間違った馬に賭けてしまった」という批判ではなく、「十分なマーケティングとロビー活動で対処可能」という批判に近いかもしれません。
AI 啓発の熱心な売り手と、データセンター内のすべての高価な GPU が確実に使用されるようにしたいだけのクラウド ベンダーのおかげで、LLM はすでに公開アプリケーションに導入されています。そして開発者は、 AIベンダーの話を聞くには、コーディングアシスタントAIが大好きです。彼らは明らかに生産性を向上させ、コーダーを離れます 自分の仕事の品質にもっと自信を持つ。
それでも、研究者らは、生成 AI モデルが偽のパッケージを捏造する可能性を評価したいと考えていました。そこで彼らは、商用およびオープン ソースの両方の 16 の人気のある LLM を使用して、JavaScript と Python で 576,000 のコード サンプルを生成しました。これらのコード サンプルは、それぞれ npm と PyPI パッケージ リポジトリに依存しています。
結果には、まだ不十分な点が残されました。
「私たちの調査結果では、幻覚を呈するパッケージの平均割合が商用モデルで少なくとも 5.2 パーセント、オープンソース モデルで 21.7 パーセントであることが明らかになりました。これには、幻覚を呈するパッケージ名の一意の例が 205,474 個も含まれており、この脅威の深刻さと蔓延性がさらに強調されています。」著者は述べています。
一連の調査プロンプトから実行された 30 のテストの結果、223 万個のパッケージが作成されました。そのうちの約 20 パーセント (440,445 個) は幻覚であると判明しました。そのうち 205,474 個は、PyPI や npm では見つからない、存在しない固有のパッケージでした。
ここで注目すべき点は、商用モデルがオープンソース モデルに比べてパッケージ名を捏造する可能性が 4 分の 1 であるという事実を超えて、これらの結果が Lasso Security の GPT-3.5 に関する数値 (5.76 パーセント対 24.2 パーセント) よりも幻覚が 4 ~ 6 倍少ないことを示していることです。 GPT-4 (4.05 パーセント対 22.2 パーセント)。それは何かを意味します。
荷物の幻覚の可能性を減らすにはコストがかかります。研究者らは、DeepSeek Coder 6.7B および CodeLlama 7B モデルを使用して、迅速な対応を支援するための有効なパッケージ名のリストを提供する検索拡張生成 (RAG) による軽減戦略と、発明されたパッケージをフィルタリングするための教師あり微調整を実装しました。モデルを保持します。その結果、コードの品質は犠牲になりましたが、幻覚は減少しました。
「パッケージ幻覚率の大幅な改善と引き換えに、微調整されたモデルのコード品質は大幅に低下し、DeepSeekとCodeLlamaではそれぞれ-26.1パーセントと-3.1パーセントでした」と研究者らは書いている。
サイズも重要
で 他の勉強 スペインのバレンシア人工知能研究所のホセ・エルナンデス・オラロ氏らは、AI 幻覚を調査し、規模が拡大するにつれて LLM の信頼性が低下することを発見しました。
研究者らは、OpenAI の GPT、Meta の LLaMA、BigScience のオープンソース BLOOM の 3 つのモデル ファミリを検討しました。彼らは、足し算、単語のアナグラム、地理的知識、科学、情報指向の変換に関する質問を行い、さまざまなモデルをそれ自体の拡大バージョン (より多くのパラメーター) に対してテストしました。
彼らは、大規模なモデル (微調整とより多くのパラメーターを使用して形成されたモデル) の方が答えの精度は高いものの、信頼性が低いことを発見しました。
これは、小規模なモデルは、答えられないプロンプトへの応答を回避するのに対し、大規模なモデルは、もっともらしいが間違った答えを提供する可能性が高いためです。したがって、不正確な回答の部分は不正確な回答の大部分で構成され、回避された回答はそれに応じて減少します。
この傾向は、特に OpenAI の GPT ファミリで顕著でした。研究者らは、以前の世代のモデルでは信頼できる予測が存在しない場合には応答を避けていたであろう、GPT-4 がほとんどすべてに応答することを発見しました。
さらに問題を複雑にしているのは、人間は LLM の回答を評価するのが苦手であり、間違った回答を正解として分類していることです。 10~40パーセントくらい 当時の。
エルナンデス=オラロ氏とその共著者らは、研究結果に基づいて、「これらのシステムを人間の監視に依存することは、特に真実が重要な分野では危険である」と主張している。
これは長々とした言い換え方法です Microsoft の AI ボイラープレート、重要なことにはAIを使用しないよう警告しています。
」[E]初期のモデルはユーザーの質問を避けることがよくありますが、スケールアップされ整形されたモデルは、人間の監督者が頻繁に見落とす難しい質問に関するエラーを含め、一見賢明であるにもかかわらず間違った答えを与える傾向がはるかに高いです」と研究者は結論付けています。
「これらの発見は、汎用人工知能の設計と開発における根本的な転換の必要性を浮き彫りにしています。特に、予測可能なエラーの分布が最も重要な一か八かの分野においてです。」 ®
#コードヘルパーはパッケージ名の発明をやめられない #Register