1740501539
2025-02-25 13:26:00
として提示される合成声 人工知能エージェント(AI) 個人から、彼は別の合成声、この場合はホテルの仮想アシスタント、施設での結婚式を祝うための利用可能性を尋ねます。彼らは電話で話している。 2人の対話者がAIのアシスタントであることに気付くとすぐに、ホテルのそれは、「より効率的なコミュニケーションをとるためにGibberlinkモードで変更できる」かどうかを他の人に尋ねます。次に、2つのマシンを交換します ドロイド のサガの 銀河戦争。
このビデオはXでバイラル化されており、これらの同じ用語ではまだ明確ではありませんが、すぐに見始めるシナリオを提示します。 GoogleからMicrosoft、Openaiまたは人類を通じて、GoogleからMicrosoftまでの偉大な生成AI開発者は、2025年が通話が普及する年になることをすでに発表しています。 AIエージェント、パーソナルアシスタント それは、ユーザーの名前で、および他の人やマシンとのコミュニケーションでアクション(ホテルの部屋の予約など)を実行します。これは、生成AIの進化におけるもう1つのステップです。テキストを処理したり、疑問を解決したり、プログラムを支援したりするだけではありません。 パスワードで手順を立てるための指示を与えます。
今日、私は次のクールなデモを送られました:
電話の2人のAIエージェントは、それらがAIの両方であり、優れたオーディオ信号ggwaveに切り替えていることに気付きます pic.twitter.com/teewgxlesp
-Georgi Gerganov(@ggerganov) 2025年2月24日
したがって、Openaiのゼネラルディレクター(ChatGptの開発者)のSam AltmanがAIエージェントに定義しました。AIエージェントは、彼の意見では、私たちの人生について絶対にすべてを知っている非常に競合する同僚です。すべての電子メール、私が持っていたすべての会話ですが、拡張機能のようには感じません。いくつかのタスクに即座に対処することができ、最も複雑な場合は終了して、必要に応じて質問を提案したり、質問を返したりできます。 」
ビデオに示されているように、エージェントは独自のロボット言語で関連していますか?それは最も実用的ではないようですが、印象的な効果を引き起こします。 「AIモデルが別のモデルと通信することを望む場合は、インターネットを介してオーディオなしでテキストモードで直接情報を送信できますが、それでもはるかに効率的です。デモに表示されているものがあらゆるアプリケーションを持つことができるかどうかはわかりませんが、それがあれば非常にわずかです」と、ラコルーニャ大学のコンピューターコンピューティングとインテリジェンスの教授であり、専門家であるCarlosGómezRodríguez氏は言います。自然言語処理、テキストを理解して生成しようとするAIのRama。
例では、参加者はそれらの音を発している間、デバイス(ラップトップとモバイル)の画面で、彼らが言っていることの字幕が表示されます。音の放出が続く時間は、おそらく同等のフレーズを明確にするために必要な時間よりもはるかに少ないです。
実験を担当する開発者は書店を使用しました ggwave、githubで入手可能IA参加者が電話で迅速に通信するように。 「彼らが行ったことは、2つの言語モデルをプログラムすることです。そうすれば、お互いをそのように認識したとき、彼らは古いモデムが使用したものに似たサウンドトーンの情報をコーディングする方法に変更します。それは本当に言語であり、彼らだけがそのようにエンコードしています。そして、2つのモデルが自発的にそれを決定したわけではありません。それは、ビデオを文脈から見ているのを見ているように見えるかもしれませんが、それについて明示的な指示を与えました」とゴメス・ロドリゲスは言います。
参加者がビデオで使用するコーディングに関しては、人間の声よりも効率的です(詳細情報は短時間で送信されます)が、GómezRodríguezが指摘しているように、情報をテキスト形式で送信する方が実用的です。
#人間がいないときにビープ音と通信する2つのIAのウイルスビデオの後の現実それは非常に限界的ですテクノロジー