1758782505
2025-09-25 08:00:00
独自のベンチマークは、既存のAIベンチマークのギャップに対処する多言語の生産性シナリオをサポートしています
Samsung Electronicsは本日、AIの生産性を評価するためにSamsung Researchによって開発された独自のベンチマークであるTrueBench(信頼できる現実世界の使用評価ベンチマーク)を発表しました。
TrueBenchは、現実世界の職場生産性アプリケーションでの大規模な言語モデル(LLM)がどのように機能するかを測定するための包括的なメトリックセットを提供します。現実的な評価を確保するために、多様な対話シナリオと多言語条件が組み込まれています。
Samsungの生産性のためのAIの社内使用を利用して、TrueBenchは、10のカテゴリと46のサブカテゴリにわたって、コンテンツ生成、データ分析、要約、翻訳など、一般的に使用されるエンタープライズタスクを評価します。このベンチマークは、人間とAIの両方によって協力的に設計および洗練された基準に基づいて、AI駆動の自動評価で信頼できるスコアリングを保証します。
「Samsung Researchは、実際のAI体験を通じて深い専門知識と競争力をもたらします」と、Samsung ElectronicsのDX部門のCTOであり、Samsung Researchの責任者であるPaul(Kyungwhoon)Cheun氏は述べています。 「TrueBenchが生産性のための評価基準を確立し、Samsungの技術的リーダーシップを固めることを期待しています。」
最近、企業がタスクにAIを採用するにつれて、LLMの生産性を測定するための需要が高まっています。ただし、既存のベンチマークは主に全体的なパフォーマンスを測定し、ほとんどが英語中心であり、単一ターンの質問回答構造に限定されています。これにより、実際の作業環境を反映する能力が制限されます。
これらの制限に対処するために、TrueBenchは、10のカテゴリと12の言語にわたって合計2,485のテストセットで構成されています1 – 言語間シナリオもサポートしています。テストセットでは、AIモデルが実際に解決できるものを調べ、Samsung Researchは、8文字の短い文字から20,000文字以上のテストセットを適用し、簡単な要求から長い文書の要約までのタスクを反映しています。
AIモデルのパフォーマンスを評価するには、AIの応答が正しいかどうかを判断するための明確な基準を持つことが重要です。実際の状況では、すべてのユーザーの意図が指示に明示的に記載されているわけではありません。 TrueBenchは、回答の正確性だけでなく、ユーザーの暗黙のニーズを満たす詳細な条件を考慮することにより、現実的な評価を可能にするように設計されています。
Samsung Researchは、人間とAIの間のコラボレーションを通じて評価項目を検証しました。最初に、ヒトのアノテーターは評価基準を作成し、次にAIがそれをレビューして、エラー、矛盾、または不必要な制約をチェックします。その後、ヒトのアノテーターが再び基準を改良し、このプロセスを繰り返して、ますます正確な評価基準を適用します。これらのクロス検証基準に基づいて、AIモデルの自動評価が実施され、主観的なバイアスが最小限に抑えられ、一貫性が確保されます。さらに、各テストについて、モデルが合格するにはすべての条件が満たされる必要があります。これにより、タスク全体でより詳細かつ正確なスコアリングが可能になります。
TrueBenchのデータサンプルとリーダーボードは、グローバルオープンソースプラットフォームの顔を抱きしめる顔で利用できます。これにより、ユーザーは最大5つのモデルを比較し、一目で包括的なAIモデルパフォーマンスの比較を可能にします。さらに、応答結果の平均長さに関するデータも公開されており、パフォーマンスと効率の両方の同時比較を可能にします。詳細情報は、TrueBenchを抱き締める顔のページにあります https://huggingface.co/spaces/samsungresearch/truebench。
1 中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポーランド語、ポルトガル語、ロシア語、スペイン語、ベトナム語
#現実世界のAI生産性のベンチマーク #Samsung #Global #Newsroom