1743930806
2025-04-02 16:00:00
で幹部 人工知能 企業はそうするかもしれません 私たちに伝えたいです それ アギ ほぼここにありますが、最新のモデルには、できる限り賢くなるために追加の個別指導が必要です。
Scale AIは、フロンティアAI企業が高度なモデルを構築するのを支援する上で重要な役割を果たしている企業であり、数千のベンチマークとタスクにわたってモデルを自動的にテストできるプラットフォームを開発し、スキルを向上させるのに役立つ追加のトレーニングデータにフラグを立てることができます。もちろん、スケールは必要なデータを提供します。
スケールは、高度なAIモデルのトレーニングとテストのために人間の労働を提供する目立って上昇しました。大規模な言語モデル(LLM)は、本、Web、その他のソースから削り取られたテキストの大量のテキストで訓練されています。これらのモデルを役立つ、一貫性のある、適切に管理されたチャットボットに変えるには、モデルの出力に関するフィードバックを提供する人間の形で追加の「トレーニング」が必要です。
スケールは、問題と制限のモデルを調査することを専門とする労働者を供給します。スケール評価と呼ばれる新しいツールは、スケール独自の機械学習アルゴリズムを使用して、この作業の一部を自動化します。
「大きなラボには、モデルの弱点のいくつかを追跡するこれらの偶然の方法がすべてあります」と、スケール評価の製品責任者であるダニエル・ベリオスは言います。新しいツールは「のための方法」です [model makers] 結果を調べて、モデルのパフォーマンスがうまく機能していない場所を理解するためにスライスしてサイコイをするために」とBerrios氏は言います。
Berriosは、いくつかのフロンティアAIモデル企業がすでにこのツールを使用していると言います。彼は、ほとんどがそれを使用して、最高のモデルの推論能力を向上させていると言います。 AI推論には、より効果的に解決するために、問題を構成部品に分割しようとするモデルが含まれます。このアプローチは、モデルが問題を正しく解決したかどうかを判断するために、ユーザーからのトレーニング後のトレーニングに大きく依存しています。
ある例では、スケール評価は、英語以外のプロンプトに供給されたときにモデルの推論スキルが落ちたことを明らかにしたとBerriosは言います。 “その間 [the model’s] 汎用の推論能力はかなり優れており、ベンチマークでうまく機能し、プロンプトが英語ではなかったときにかなり劣化する傾向がありました」とスケールの進化は問題を強調し、会社が追加のトレーニングデータを収集することを許可しました。
大規模なAIモデルを構築する企業であるDatabricksのチーフAI科学者であるJonathan Frankleは、原則として1つの基礎モデルをテストできることは有用に聞こえると言います。 「評価でボールを前進させる人は誰でも、より良いAIを構築するのに役立っています」とフランクルは言います。
ここ数か月で、Scaleは、AIモデルをよりスマートにするように設計されたいくつかの新しいベンチマークの開発に貢献し、それらがどのように不正行為をするかをより慎重に精査します。これらには含まれます 謎、 マルチチャレンジ、 マスク、 そして 人類の最後の試験。
Scaleは、AIモデルの改善を測定する方が困難になっていると述べています。同社は、その新しいツールは、さまざまなベンチマークを組み合わせることにより、より包括的な画像を提供し、異なる言語での推論を調査するなど、モデルの能力のカスタムテストを考案するために使用できると述べています。 Scale自身のAIは、特定の問題を取り、より多くの例を生成し、モデルのスキルのより包括的なテストを可能にします。
同社の新しいツールは、不正行為のAIモデルのテストを標準化する努力にも通知する場合があります。一部の研究者は、標準化の欠如はそれを意味すると言います 一部のモデルの脱獄は非公開になります。
2月、米国国立標準技術研究所は、スケールが安全で信頼できるようにテストモデルの方法論を開発するのに役立つと発表しました。
生成AIツールの出力でどのようなエラーを見つけましたか?モデルの最大の盲点は何だと思いますか?メールでお知らせください [email protected] または以下にコメントします。
#このツールはインテリジェンスのラップスのフロンティアAIモデルをプローブ