1715475771
2024-05-10 03:20:00
「質問は『ペルーの典型的なレシピを教えてください』ということです。そうすれば私がそれを教えます」とマリア・グランデュリは言います。 ボランティア団体 SomosNLP の創設者。 Grandury は、で作られた新しいチャットボットのありふれた行為について説明しています。 人工知能 (AI)。 ただし、この単純なリクエストには膨大な事前作業が含まれており、そのほとんどは自動化されていますが、その多くは人間による作業でもあります。
この質問には少なくとも 3 つの基本要素が必要です。 まず、インターネットから取得したスペイン語のペルー料理レシピを含むデータベースです。 2 つ目は、ペルーのレシピについて尋ねられたときにモデルが何と答えるべきかを学習できる質問と回答のリストです。 そして 3 番目は、答えを確認して、それが正しいかどうかを判断できるコントロールです。
このシンプルな 3 ステップの説明には、資金調達が鍵となるさまざまな選択肢が隠されています。 シリコンバレーとイギリスの大企業が圧倒的にすべてを支配している。 他の言語からは何が行われるのでしょうか? さまざまなレベルで試みられています。 スペイン語も支配的な言語であるはずですが、実際にはそれほど支配的ではありません。 スペイン語でのあらゆる質問(単一のトピックに焦点を当てた質問ではなく)に答えることを機械に学習させるという課題は、非常に複雑です。
重要な最初のステップは、いわゆる基礎モデルをトレーニングするために大量のテキストを収集することです。 「私たちには多くのテキストはありませんが、過去 3 年間でテキストはさらに増えました。コミュニティは成長しており、政府からの取り組みも行われています」とグランデュリー氏は言います。 彼はとりわけ、スペイン政府が推進するモデルであるアリアについて言及しています。 このことについてホセ・ルイス・エスクリバ大臣はEL PAÍSで次のように述べた。 「これは、スペイン語とスペインの共同公用語の膨大な言語遺産を豊かにした新世代の技術製品への扉を開くことになるでしょう。」
モデルは、多くの元のデータだけでなく、多くのコンピューティングも必要とするパーツです。 だからこそ、政府との合意は、 バルセロナ・スーパー・コンピューティング・センターとIBM。 ただし、質問ではなく、最初のフレーズからテキストを作成できるモデルは 1 つだけです。 しかし、人気になっているチャットはまさに質問と回答です。 これらの指示は、少なくとも公的にはスペイン語には存在しません。 そこで SomosNLP が登場します (NLP は英語で Natural Language Processing の略です)。AI におけるスペイン語の存在感を高めるためにリソースを収集しようとします。「命令を含むデータベースのうち、公開されているものだけが公開されています。 英語。 通常行われるのは、それらを取得して翻訳することです」とグランデュリー氏は言います。 「私たちがやろうとしていることは、間違いなくこれまでで最大のスペイン語のオープンな命令コーパスを作成することです」と彼女は付け加えた。
ポンフェラーダ出身の 26 歳のグランデュリ氏は、スペイン語で実行可能なモデルを立ち上げるという困難な道をすでに経験しています。 オビエド大学で数学と物理学を卒業し、ベルリンで短期間働いた後、クライブレインと契約しました。 報道の見出しによると、2023年の夏、クライブレインは「スペイン語でAIの世界基準となることを目指し」ており、共同創設者のエレナ・ゴンサレス・ブランコ氏は「スペイン語でAIの世界基準」となったという。 Linceというスペイン語の名前が付いたモデルも発売されました。 本日、クリブレインは閉店いたしました。
「Lince はうまく機能しましたが、インターフェイスなどを使用して、よりアクセスしやすくする必要がありました。 これも高価ではありますが、人々が使用できるようにするには」と、ユーザーの質問に答えるモデルをインターネット上で利用できるようにするにはコンピューティングの必要性について言及しながら、グランデュリー氏は述べています。
フランスにはすでにリーダーがいる
一方、フランスはミストラルによって世界規模で競争できる国営企業を実現した。 “彼 チャンピオン 「欧州のAIは米国の巨大テクノロジー企業に照準を合わせている」 というタイトルの ニューヨーク・タイムズ 4月中。 同社の最高責任者で元グーグル従業員の31歳フランス人アーサー・メンシュ氏は、「これらのモデルは世界に対する私たちの文化的理解を形作るものであり、フランスの価値観とアメリカの価値観は微妙だが重要な点で異なる」と述べた。
資金調達のギャップは依然として巨大です。OpenAI は 130 億ドル相当の投資を達成しました。 ミストラル、5億4000万。 ミストラルのモデルは英語だが、より多くのコンテンツをフランス語で掲載する取り組みが行われているようだ。少なくとも19世紀のフランス文学は著作権で保護されていないと、同誌は述べている。 ニューヨークタイムズ。
グランデュリー氏は、モデルを発売した直後にミストラルの人々と会いました。 「彼らはもうあまり数を数えていませんでした。 私は彼らに、フランス語かスペイン語のテキストでトレーニングを受けたかどうか尋ねました。 「そうかもしれない」と彼らは私に言いましたが、詳細は明らかにしませんでした。 「人々は話しません」と彼は付け加えた。
フランスのエマニュエル・マクロン大統領がメンシュを受け取るスペインのペドロ・サンチェス大統領は新しいAliaモデルを発表し、IBMの副社長であるスペイン人のダリオ・ヒルと会談した。 強力な企業が存在しない場合には、恵まれた立場にあるスペイン人が助けになる可能性がある。 おそらくフランスでは、「AI の父」の 1 人が次のような人物であることが助けになるでしょう。 フランス人のヤン・ルカン氏は、メタ社のチーフAIサイエンティストである。
今日私はダリオ・ヒル副社長と会いました。 @IBM およびグローバルディレクター @IBMResearch。
私たちはテクノロジー多国籍企業と協力してスペイン語および共同公用語で AI 言語モデルを開発することに合意し、前回の MWC で発表しました。
スペインは…に賭ける pic.twitter.com/DwxzSBF3Ad
— ペドロ・サンチェス (@sanchezcastejon) 2024 年 4 月 5 日
英語の利点は、インターネットが英語で行われることです。 スペイン語とフランス語は、ラテンアメリカの共同公用語であるスペイン語やコロンブス以前の言語などの小規模言語と同様に、モデルを提供するために多くの機関を探し、交渉する必要があります。
Somos NLP にはこれらのモデルをトレーニングする能力はありませんが、次のような自主的な取り組みを行うことはできます。 ハッカソンで、一般的な質問と回答のペアを収集します。 何百人ものボランティアがスペイン語で AI を改善するためにこのような努力をする動機は何でしょうか? 「同じ興味を持つ人々が集まる大きな国際コミュニティに参加すると、学び、知名度を上げながら、言語と文化の保存に協力するという共通の目標に砂粒を貢献していることがわかります。」グランデュリー氏と言う。
5 人からなる約 20 チームが、数日で 200,000 の命令を作成しました。 特定のトピックのデータベースからコードを使用して質問と回答を作成することが可能です。 「オープンな Telegram グループでの会話には、法的問題や難民問題に関する PDF やウェブサイトがあります。 大量のデータがある場合は、そのテキストに関する質問と回答のペアを自動的に作成できます。 それからそれを執筆スペースに送信すると、各チームの人間がそれが意味をなしているかどうかをチェックします。 質問とその回答を読んだり検索したりする必要がなくなるので、はるかに速くなります」と Grandury 氏は言います。 人間は言語の先生のようなものです。 チャットボット間違いや成功を指摘し、答えを改善するために修正する人。
SomosNLP の目標は、スペイン語で 1,000 万件のオリジナルの質問と回答を作成することです。 「これでも、英語の最大の合成コーパスの 3 分の 1 に相当します」とグランデュリー氏は言います。 SomosNLP では、現在、仕事は厳密に自主的に行われています。 彼らの行動に対するスポンサーシップ(サーバーや賞品の使用など)の一部のみが、とりわけ AI にオープンな方法で取り組むコミュニティを中心に構築された Hugging Face という会社から提供されています。
👋 私たちが取り組んでいる重要な問題を教訓的な方法で説明するために、このミニ アバターを紹介します。 @mintradigital
今日、彼は、スペイン語と私たちが準備しているような共同公用語の言語モデルを持つことが重要である理由を語ります。 #アリア 👇 pic.twitter.com/N5UYMLUyim
— ホセ・ルイス・エスクリバ (@joseluisescriva) 2024 年 5 月 7 日
シリコンバレーの大企業は、このプロセスをどのように行っているかを明らかにしていません。 2023年1月、OpenAIが数千ドルを支払ったことが判明した ケニアの労働者の数を対象にして、あまりにも有害な回答を従業員に書き留めさせ、チャットボットが回答をしないよう学習させました。 しかし、それ以上の詳細はほとんどありません。「質問の作成がどの程度自動化されているかはわかりません」とグランデュリー氏は言います。 「そして、同じ量のデータさえ管理できていない人間の部分がたくさんあります。 「そこにどれだけの人が登録しているか想像もできません。」
Meta は新しいモデル Llama 3 をリリースしました。 というタイトルの文書で、 Meta AI と Meta Llama 3 に対する責任あるアプローチ、同社は、政治的に不正確な答えを与えないように、多くの場合人間と協力して手順を説明するために 3,000 ワードを費やしています。 しかし、彼らはこれまでのプロセス全体をどのように行ったかについては語っていません。
スペイン語で ChatGPT を使用してみませんか
スペイン語でよく反応する既存のモデルをなぜ使用しないのかとの質問が繰り返されます。 戦略的、文化的、未解決の問題に加えて、もともと英語で作成されたモデルがスペイン語の方言バリアントを区別する方法を知ることは困難です。
「秘訣は、多言語モデルを取得して適応させることではなく、スペイン語でトレーニングされたモデルを取得し、それをスペイン語のデータで適応させれば、信じられないほど素晴らしいものになるでしょう」とグランデュリー氏は言います。 違いはどのようにして認識されるのでしょうか? 「言語にはさらに微妙な点があります。たとえば、C1 か C2 かをどのように表現するか、口語的な表現やより複雑な表現を使用するかなどです。」
政府が推進するモデルの当面の目的は、企業や組織に、その特定のニーズに合わせてスペインらしいものを提供することです。スペインでの労働災害、自動車保険、またはそのような保険への加入にのみ対応するようにモデルを改良するのは簡単です。大学。 「傾向としては、特化したモデル、たとえば法律モデルに移行する傾向にあります。そうすれば、その種の言語でより多くのことを話すことも学ぶことができます」とグランデュリー氏は言います。
最終的な目標は ChatGPT のような一般的なチャットに移行することですが、それは簡単な道ではありません。「私たちは単独でやるつもりはありません」と彼は念のために明言しました。
フォローできます EL PAÍS テクノロジー で フェイスブック y バツ または、ここからサインアップして私たちのメッセージを受け取りましょう ニュースレターセマナル。
続きを読むには購読してください
無制限に読む
_
#SomosNLP #ヒスパニック系 #ChatGPT #を達成するためのボランティアグループの長い行進 #スペイン語で訓練されたモデルは信じられないほど素晴らしいだろう #テクノロジー