日本語版
最新ニュース
科学&テクノロジー

AI の新しい言語の教育がデータから始まる理由 – Samsung Global Newsroom

インドネシアの Samsung Research は、モバイル AI の民主化の背後にある人々とイノベーションに関するシリーズの一部です Samsung がプレミアム モバイル AI エクスペリエンスを開拓し続ける中、私たちは世界中の Samsung Research センターを訪問し、Galaxy AI がどのようにしてより多くのユーザーの可能性を最大限に引き出しているのかを学びました。 Galaxy AI は現在 16 の言語をサポートしているため、ライブ翻訳、通訳、メモ アシスト、ブラウジング アシストなどの機能によるオンデバイス翻訳のおかげで、オフラインでもより多くの人が言語機能を拡張できます。 しかし、AI 言語開発には何が関係するのでしょうか? このシリーズでは、モバイル AI を使用する際の課題と、それをどのように克服したかを検証します。 まず、AI に新しい言語を教える場所を学ぶためにインドネシアへ向かいます。 サムスン研究開発研究所インドネシア(SRIN)のチームによると、最初のステップは目標を設定することだという。 「優れた AI は、高品質で関連性の高いデータから始まります。 言語ごとにこれを処理するための異なる方法が必要なので、私たちは言語のニーズと我が国特有の状況を理解するために深く掘り下げています」と SRIN の AI…

AI の新しい言語の教育がデータから始まる理由 – Samsung Global Newsroom

1715424437
2024-05-10 14:50:29

インドネシアの Samsung Research は、モバイル AI の民主化の背後にある人々とイノベーションに関するシリーズの一部です

Samsung がプレミアム モバイル AI エクスペリエンスを開拓し続ける中、私たちは世界中の Samsung Research センターを訪問し、Galaxy AI がどのようにしてより多くのユーザーの可能性を最大限に引き出しているのかを学びました。 Galaxy AI は現在 16 の言語をサポートしているため、ライブ翻訳、通訳、メモ アシスト、ブラウジング アシストなどの機能によるオンデバイス翻訳のおかげで、オフラインでもより多くの人が言語機能を拡張できます。 しかし、AI 言語開発には何が関係するのでしょうか? このシリーズでは、モバイル AI を使用する際の課題と、それをどのように克服したかを検証します。 まず、AI に新しい言語を教える場所を学ぶためにインドネシアへ向かいます。

サムスン研究開発研究所インドネシア(SRIN)のチームによると、最初のステップは目標を設定することだという。 「優れた AI は、高品質で関連性の高いデータから始まります。 言語ごとにこれを処理するための異なる方法が必要なので、私たちは言語のニーズと我が国特有の状況を理解するために深く掘り下げています」と SRIN の AI 責任者であるジュナイディラ・ファドリル氏は述べています。SRIN のチームは最近、インドネシア語 (インドネシア語) のサポートを追加しました。ギャラクシーAI。 「ローカル言語の開発は洞察力と科学によって導かれる必要があります。そのため、Galaxy AI に言語を追加するすべてのプロセスは、どのような情報が必要で、法的および倫理的に取得できるかを計画することから始まります。」

Live Translate などの Galaxy AI 機能は、自動音声認識 (ASR)、ニューラル機械翻訳 (NMT)、テキスト読み上げ (TTS) という 3 つのコア プロセスを実行します。 各プロセスには個別の情報セットが必要です。

たとえば、ASR では、さまざまな環境での音声の大規模な録音と、正確なテキストの書き起こしが必要です。 さまざまな背景騒音レベルは、さまざまな環境を考慮するのに役立ちます。 「録音にノイズを追加するだけでは十分ではありません」とチームの ASR リーダーである Muchlisin Adi Saputra は説明します。 「認可された機関から取得した言語データに加えて、 第三者 パートナーである私たちは、コーヒーショップや職場に出かけて自分の声を録音しなければなりません。 これにより、人々の叫び声やキーボードのカチャカチャ音など、現実世界のユニークなサウンドを忠実にキャプチャすることができます。」

言語の絶えず変化する性質も考慮する必要があります。 サプトラ氏はさらに、「最新のスラングとその使い方を常に最新の状態に保つ必要があります。スラングは主にソーシャル メディアで見つけます。」と付け加えました。

次に、NMT には翻訳トレーニング データが必要です。 「インドネシア語の翻訳は困難です」とチームの NMT リーダー、ムハマド ファイサルは言います。 「文脈上の意味と暗黙的な意味の広範な使用は、社会的および状況的な手がかりに依存しているため、AI が新しい単語、外来語、固有名詞、慣用句など、文脈やルールを理解するのに役立つ情報を AI が参照できる多数の翻訳テキストが必要です。コミュニケーション。”

次に、TTS では、さまざまな状況で単語の一部がどのように聞こえるかについての追加のコンテキストを含め、さまざまな声やトーンをカバーする録音が必要です。 「優れた音声録音があれば、仕事の半分を果たし、AI モデルに必要なすべての音素 (音声の音の単位) をカバーできます。」と TTS リーダーの Harits Abdurrohman 氏は付け加えます。 「声優が初期の段階で素晴らしい仕事をした場合、焦点は特定の単語を明確に発音するように AI モデルを改良することに移ります。」

共に強くなる

多くのデータを計画するには膨大なリソースが必要であり、SRIN は言語学の専門家と緊密に連携しました。 「この課題には、インドネシア語と機械学習の両方における創造性、機知、専門知識が必要です」とファドリル氏は振り返ります。 「サムスンのオープンコラボレーションの哲学は、当社の事業規模やAI開発の歴史と同様に、仕事を成し遂げる上で大きな役割を果たしました。」

SRIN チームは、世界中の他の Samsung Research センターと協力して、ベスト プラクティスを迅速に採用し、データ ターゲットを確立する際の複雑さを克服することができました。 さらに、コラボレーションは技術だけでなく文化の発展にも役立ちました。 SRIN チームがインドのバンガロールのチームに加わったとき、彼らは地元の断食習慣を観察し、より深いつながりを築き、異文化への理解を広げました。

チームにとって、Galaxy AI の言語拡張プロジェクトは新たな重要性を帯びました。 「これが私たちの最初の AI プロジェクトであったため、ここでの成果を特に誇りに思っています。モデルを改良し、出力の品質を向上させ続けるため、これが最後ではありません」と Fadlil 氏は結論付けました。 「この拡張は、オープンさという私たちの価値観を反映しているだけでなく、言語を通じて私たちの文化的アイデンティティを尊重し、組み込んでいます。」

The Learning Curve の次のエピソードでは、Samsung R&D Institute Jordan に向かい、Galaxy AI のアラビア語プロジェクトを主導したチームと話をします。 多様な方言を持つ言語の AI モデルの構築とトレーニングの複雑さについて学びましょう。

#の新しい言語の教育がデータから始まる理由 #Samsung #Global #Newsroom

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。