日本語版
最新ニュース
科学&テクノロジー

ヒルツィク氏:Apple は AI の利点について熟考している

この算術問題を解決できるかどうかを確認してください。オリバーは金曜日に44個のキウイを摘み取りました。そして土曜日に58個のキウイを収穫します。日曜日には金曜日の2倍の数のキウイを収穫したが、そのうちの5個は平均より少し少なかった。オリバーはキウイを何個持っていますか。「190」と答えた場合は、おめでとうございます。正解したことで、平均的な小学生と同じくらいの成績を収めました。 (金曜日の 44 プラス土曜日の 58 プラス日曜日の 44 に 2 を掛ける、つまり 88 は 190 となります。) また、Apple の AI 研究チームによってテストされた 20 を超える最先端の人工知能モデルよりも優れた結果を出しました。彼らは、AI ボットが常に間違っていることを発見しました。 Apple がこれを実行したという事実は多くの注目を集めましたが、その結果に驚く人はいません。 — AI評論家ゲイリー・マーカス Apple チームは、エッセイ形式で書かれた単純な数学問題を解析しようとしたときに、これらのモデルによる「壊滅的なパフォーマンスの低下」を発見しました。この例では、質問を課せられたシステムは、キウイのサイズがオリバーが持っているキウイの数と何の関係もないことを理解していないことがよくありました。その結果、合計から小さめのキウイ 5 個を引いて、「185 個」と答える人もいました。 研究者らは、人間の学童は、関連情報と取るに足らない変化球との違いを見つけるのがはるかに優れていると主張した。 ニュースレター Michael Hiltzik から最新情報を入手 ピューリッツァー賞受賞者による経済学などの解説。 メールアドレスを入力してください サインアップしてください…

ヒルツィク氏:Apple は AI の利点について熟考している

1730661611
2024-11-01 10:00:00

この算術問題を解決できるかどうかを確認してください。

オリバーは金曜日に44個のキウイを摘み取りました。そして土曜日に58個のキウイを収穫します。日曜日には金曜日の2倍の数のキウイを収穫したが、そのうちの5個は平均より少し少なかった。オリバーはキウイを何個持っていますか。

「190」と答えた場合は、おめでとうございます。正解したことで、平均的な小学生と同じくらいの成績を収めました。 (金曜日の 44 プラス土曜日の 58 プラス日曜日の 44 に 2 を掛ける、つまり 88 は 190 となります。)

また、Apple の AI 研究チームによってテストされた 20 を超える最先端の人工知能モデルよりも優れた結果を出しました。彼らは、AI ボットが常に間違っていることを発見しました。

Apple がこれを実行したという事実は多くの注目を集めましたが、その結果に驚く人はいません。

— AI評論家ゲイリー・マーカス

Apple チームは、エッセイ形式で書かれた単純な数学問題を解析しようとしたときに、これらのモデルによる「壊滅的なパフォーマンスの低下」を発見しました。この例では、質問を課せられたシステムは、キウイのサイズがオリバーが持っているキウイの数と何の関係もないことを理解していないことがよくありました。その結果、合計から小さめのキウイ 5 個を引いて、「185 個」と答える人もいました。

研究者らは、人間の学童は、関連情報と取るに足らない変化球との違いを見つけるのがはるかに優れていると主張した。

Apple の調査結果は 10 月に出版されました。 技術論文 この研究は、AI 研究所や一般報道機関の間で広く注目を集めています。その理由は、その結果が十分に文書化されているだけでなく、研究者たちが国内有数のハイテク消費者企業で働いているためでもあります。 iPhone ユーザー向けに一連の AI 機能と称される機能を展開

「Apple がこれを行ったという事実は多くの注目を集めていますが、その結果には誰も驚かないはずです」と、AI システムがいかに確実に、まあ「インテリジェント」であるかのように宣伝されてきたことを批判するゲーリー・マーカスは言う。

実際、Apple の結論は、大規模言語モデル (LLM) は実際には「トレーニング」の一環として与えられた教材の言語パターンと一致するほど「思考」しないという以前の研究と一致しています。サンタフェ研究所の認知と知性の専門家であるメラニー・ミッチェルの言葉を借りれば、「人間の知性の重要な側面」である抽象的な推論に関しては、モデルでは不十分です。

「幼い子どもでも、ほんの数例から抽象的なルールを学ぶのが上手です。」 ミッチェルと同僚は昨年こう書いた GPT ボットに一連の類推パズルを課した後。彼らの結論は、「人間と最先端のAIシステムの間には、基本的な抽象推論において依然として大きなギャップが残っている」というものだった。

GPT などの LLM が世間の注目を集めている AI 製品を支えているため、これは重要です。しかし、Apple チームがテストした LLM は、トレーニングされた言語パターンによって常に誤解されていました。

Apple の研究者たちは、「これらのモデルは数学的概念を本当に理解しているのか?」という質問に答えようとしました。筆頭著者の 1 人である Mehrdad Farajtabar 氏がこう述べています。 X のスレッド。彼らの答えはノーです。また、彼らは、特定した欠点を簡単に修正できるかどうかについても考えましたが、答えも「ノー」でした。「データ、モデル、またはコンピューティングのスケーリングによって、これを根本的に解決できるでしょうか?」ファラジタバル氏は自身のスレッドで質問した。 「私たちはそうは思いません!」

Appleの調査は、AIボットの思考力の限界に関する他の調査結果と同様に、OpenAIやGoogleのDeepMindラボなど、自社のAIモデルやシステムを宣伝する企業からの売り込みに対する修正として切望されている。

プロモーターは通常、自社の製品が信頼できるものであり、その成果も信頼できるものであると表現します。実際、その出力は一貫して疑わしいものであり、厳密な精度が絶対的に必要な状況、たとえば医療用途で使用される場合、明らかな危険をもたらします。

いつもそうとは限りません。 「完璧な解決策がなくても、大金を稼ぐことができる問題がいくつかあります」とマーカスは私に言いました。 AI を活用したレコメンデーション エンジン — たとえば、Amazon の購入者を、彼らも好みそうな商品に誘導します。それらのシステムが推奨を誤ったとしても、それは大した問題ではありません。顧客は気に入らない本に数ドルを費やすかもしれません。

「しかし、85% の確率でしか正しくない計算機はゴミです」とマーカス氏は言います。 「あなたはそれを使わないでしょう。」

有害なほど不正確な出力が生成される可能性は、AI ボットの自然言語機能によって高まります。AI ボットは、途方もなく不正確な回答であっても、説得力のある自信を持って提供します。多くの場合、彼らは挑戦されると、自分のミスを倍増させます。

これらのエラーは通常、AI 研究者によって「幻覚」と表現されます。この用語を使用すると、間違いはほとんど無害であるように思われるかもしれませんが、アプリケーションによっては、ごくわずかなエラー率であっても重大な影響を与える可能性があります。

それが学術研究者らの結論です 最近公開されたウィスパーの分析は、OpenAI が開発した AI を活用した音声テキスト変換ツールで、矯正職員が監視する医療上の会話や刑務所内での会話を文字に起こすために使用できます。

研究者らは、サンプル中のウィスパーによって書き起こされた音声セグメントの約 1.4% に、「身体的暴力や死」の描写を含む完全に捏造された発言の書き起こし会話への追加を含む幻覚が含まれていることを発見しました。 [or] 性的なほのめかし」と人口統計上の固定観念。

それは些細な欠陥のように聞こえるかもしれないが、研究者らは、その誤りが法廷証言や刑務所での電話通話の転写などの公式記録に組み込まれる可能性があり、それが「被告が決して語らなかったフレーズや主張」に基づいて公式決定が下される可能性があると観察した。 」

研究者らによると、2023年後半のWhisperのアップデートによりパフォーマンスは向上したが、アップデートされたWhisperは「依然として定期的かつ再現性のある幻覚症状を呈する」という。

だからといって、AI プロモーターが自社製品について不当に自慢することを思いとどまることはできません。で 10月29日のツイートイーロン・マスク氏はフォロワーに「X線、PET、MRI、またはその他の医療画像をGrokに提出するよう呼びかけた」 [the AI application for his X social media platform] 分析のために。」 Grok は「すでに非常に正確であり、非常に優れたものになるだろう」と彼は書いている。

言うまでもないことですが、たとえマスク氏が真実を語っているとしても(絶対的に確実な結論ではありません)、医療提供者が医療画像を分析するために使用するシステムはすべて、「非常に優れている」よりもはるかに優れている必要がありますが、その基準を定義する人はいるかもしれません。 。

そこで Apple の調査に行き着きます。研究者たちはAIそのものを批判しているのではなく、AIの限界を理解する必要があると信じていることに注意するのは適切だろう。ファラジタバル氏は以前、ディープマインド社の上級研究員であり、そこで別の著者が彼の下でインターンをしていました。他の共著者はコンピューター サイエンスと機械学習の高度な学位と専門的経験を持っています。

研究チームは、児童の加算、減算、乗算、除算の理解をテストする 8,000 を超える小学校の算数問題の人気コレクションから抽出した問題を対象の AI モデルに組み合わせました。関連しているように見えてそうではない条項が問題に組み込まれている場合、モデルのパフォーマンスは急激に低下しました。

これは、OpenAI、Meta’s Llama によって開発された GPT ボットのバージョンを含む、すべてのモデルに当てはまります。 マイクロソフトのPhi-3Googleのジェマ によって開発されたいくつかのモデル フランスの研究所ミストラルAI

一部の企業は他の企業よりも優れた成績を収めましたが、問題がより複雑になるにつれて、すべての企業でパフォーマンスが低下しました。問題の 1 つは、消しゴム、ノート、便箋などの学用品が入ったバスケットに関するものでした。そのためには、ソルバーが各商品の数値とその価格を掛けてそれらを合計して、バスケット全体の価格を決定する必要があります。

また、ボットに「インフレのせいで、昨年の価格は 10% 安かった」と伝えると、ボットはコストを 10% 削減しました。質問はバスケットの値段が昨年ではなく今いくらになるかを尋ねているので、これは間違った答えになります。

なぜこのようなことが起こったのでしょうか?その答えは、LLM は数学的原理を教えようとするのではなく、出版作品やインターネットから収集した膨大な量の文書を与えることによって開発または訓練されるということです。 LLM は、データ内のパターンを収集し、そのパターンを当面の質問と照合しようとすることによって機能します。

しかし、彼らは「トレーニング データに過剰適合」してしまうとファラジタバル氏は X を通じて説明しました。「彼らはウェブ上にあるものを記憶し、パターン マッチングを行い、見た例に従って答えます。それはまだです [weak] 推論の一種ですが、他の定義によれば、それは真の推論能力ではありません。」 (括弧は彼のものです。)

これにより、AI の用途に限界が生じる可能性があります。ミッションクリティカルなアプリケーションでは、AI 開発者が言うように、人間はほぼ常に「ループに参加」する必要があります。つまり、明らかな不正確さまたは危険な不正確さについて答えを精査したり、ボットがデータを誤解したり、知っていることを誤って述べたり、ボットがデータを入力したりしないようにガイダンスを提供する必要があります。捏造に関する知識のギャップ。

AI システムは人間のパートナーがいないと多くのことを達成できないことを意味するため、ある程度は安心できます。しかしそれは、AI推進者が自社製品の機能を誇張し、その限界を隠蔽する傾向があることを、私たち人間が認識する必要があることも意味します。問題は、AI に何ができるかということよりも、ユーザーが AI に何ができるかという考えにどのように騙されるかということです。

「幻覚は本質的に存在するため、これらのシステムは常に間違いを犯します」とマーカス氏は言います。 「彼らが推論に取り組む方法は近似的なものであり、本物ではありません。そして、新しいテクノロジーが登場するまで、この状況が消えることはありません。」

#ヒルツィク氏Apple #は #の利点について熟考している

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。