1706994576
2024-02-03 18:59:49
AI研究所の研究者 アマゾン ウェブサービス (AWS) は、大量のオンライン コンテンツが機械翻訳 (MT) ソースから来ていることを発見しました。
このコンテンツは多くの異なる言語に翻訳されており、多くの場合低品質です。チームは、これが大規模言語モデル (LLM) をトレーニングする際のデータ品質とソースの考慮事項の重要な必要性を浮き彫りにしていると述べています。
研究者らはまた、リソースが少ない言語の翻訳では機械生成コンテンツが一般的であり、Web 上のすべてのコンテンツのかなりの部分を占めていることも発見しました。
選択バイアス
「実際、私たちがこのトピックに興味を持ったのは、MT で働き、リソースの少ない言語を母語とする数人の同僚が、母国語のインターネットの多くが MT で生成されているようだと指摘したためです」と、AWS の元応用科学インターンである Mehak Dhaliwal 氏は述べています。カリフォルニア大学サンタバーバラ校の現在の博士課程の学生はこう語った。 マザーボード。
「つまり、洞察は実際にリソースの少ない言語を話す人々から得られたものであり、私たちは問題をよりよく理解し、それがどれほど広まっているかを確認するために調査を行いました。」
チームは、機械によって翻訳されたコンテンツの特徴をより深く理解するために、Multi-Way ccMatrix (MWccMatrix) として知られる膨大なリソースを開発しました。 このリソースには、90 の異なる言語で 64 億の一意の文が含まれており、翻訳タプル (さまざまな言語の文のセットであり、相互に翻訳されたもの) が含まれています。
この研究はコーネル大学に提出された。 プレプリントサーバー arXiv、膨大な量の Web コンテンツが、主に機械翻訳によって多数の言語に翻訳されることが多いことがわかりました。 このコンテンツは、リソースが少ない言語の翻訳で広く普及しているだけでなく、これらの言語のすべての Web コンテンツのかなりの部分を占めています。
研究者らはさらに、おそらく広告収入を生み出す目的で複数の言語に翻訳されるコンテンツの種類に選択バイアスがあることにも気づきました。
この論文は、「MT技術は過去10年間で劇的に向上したが、依然として人間の資質には及ばない」と結論付けている。 MT コンテンツは、当時利用可能な MT システムを使用して長年にわたって Web に追加されてきたため、Web 上の MT の多くは、現代の標準からすると非常に低品質である可能性があります。 これにより、より多くの幻覚を伴う流暢性の低い LLM モデルが生成される可能性があり、選択バイアスは、MT エラーを考慮する前であってもデータの品質が低い可能性があることを示しています。 LLM トレーニングではデータの品質が非常に重要であり、書籍やウィキペディアの記事などの高品質のコーパスは通常、数回アップサンプリングされます。」
TechRadar Pro の詳細
#必要なだけ対戦車ミサイルを撃て #アマゾンの研究者はオープンウェブの膨大な量が #によって生成され機械翻訳されたナンセンスであることを発見しました