1745344651
2025-04-22 17:48:00
業界をリードするAIカバレッジに関する最新のアップデートと排他的なコンテンツについては、毎日および毎週のニュースレターに参加してください。もっと詳しく知る
の名前による2人のスタートアップ ナリラボ テキストプロンプトから直接自然主義的な対話を作成するように設計された16億パラメーターテキスト(TTS)モデルであるDIAを導入しました。その作成者の1人は、GoogleのHit Bookbooklm AI Podcast Generation製品、ElevenLabsのような競合専有製品のパフォーマンスを上回ると主張しています。
また、Openaiの最近のGPT-4O-MINI-TTSの摂取を脅かす可能性があります。
「Dia Rivals Notebooklmのポッドキャスト機能は、ElevenLabs StudioとSesameのオープンモデルを品質に載せています」と、NariとDiaの共同作成者の1人であるToby Kim氏は述べています。 ソーシャルネットワークXのアカウントからの投稿で
で 別々の投稿キムは、モデルが「ゼロの資金調達」で構築され、スレッドに追加されたと指摘しました。「…私たちは最初からAIの専門家ではありませんでした。昨年リリースされたときにNotebooklmのポッドキャスト機能に恋をしたときに始まりました。
さらにキム グーグルをクレジットしました 彼と彼の協力者に会社のテンソル処理ユニットチップ(TPU)へのアクセスを提供して、DIAをトレーニングするために Googleの研究クラウド。
DIAのコードとウェイト – 内部モデル接続セット – は、誰からでもダウンロードとローカル展開に利用できるようになりました 顔を抱き締める または ギルブ。個々のユーザーは、それからスピーチを生成してみることができます 顔を抱き締める 空間。
高度なコントロールとよりカスタマイズ可能な機能
DIAは、感情的なトーン、スピーカーのタグ付け、非言語的オーディオキューなどの微妙な機能をサポートしています。
ユーザーは、スピーカーターンを次のようなタグでマークできます [S1] そして [S2]、そして、(笑)、(咳)、または(喉をクリアする)などの手がかりを含めて、結果として生じる対話を非言語的行動と豊かにします。
これらのタグは、生成中にDIAによって正しく解釈されます。これは、同社の例ページによると、他の利用可能なモデルで確実にサポートされていないものです。
現在、このモデルは英語のみであり、スピーカーの声に縛られておらず、ユーザーが生成シードを修正したり、オーディオプロンプトを提供したりしない限り、実行ごとに異なる声を生成します。オーディオコンディショニング、または音声クローニングにより、ユーザーはサンプルクリップをアップロードすることにより、音声トーンと音声類似性をガイドできます。
Nari Labsは、このプロセスを容易にするためのサンプルコードとグラデーションベースのデモを提供しているため、ユーザーはセットアップなしで試してみることができます。
evlenlabsおよびsesameとの比較
ナリの申し出 オーディオファイルの例のホスト DIAによってその概念Webサイトで生成され、他の主要なスピーチツーテキストライバル、特にElevenLabs StudioとSesame CSM-1B、後者は新しいものと比較します。 Oculus VR Headsetの共同作成者Brendan Iribeのテキストからスピーチモデル それは今年初めにXでややバイラルになりました。
Nari Labsが共有する並んでいる例は、DIAがいくつかの分野で競争をどのように上回るかを示しています。
標準的な対話シナリオでは、DIAは自然なタイミングと非言語表現の両方をより適切に処理します。たとえば、(笑)で終わるスクリプトでは、DIAは実際の笑いを解釈して配信しますが、「ハハ」のような11の出力テキスト代替物を出力します。
たとえば、これがDIAです…
…そして、ElevenLabs Studioが話した同じ文
感情的な範囲との複数回の会話では、DIAはよりスムーズな移行とトーンシフトを示しています。 1つのテストには、劇的で感情的に充電された緊急シーンが含まれていました。 DIAは緊急性とスピーカーのストレスを効果的にレンダリングしましたが、競合するモデルはしばしば配達やペーシングの喪失を平らにしました。
DIAは、咳、スニッフ、笑いを含むユーモラスな交換など、非言語のみのスクリプトを独自に処理します。競合するモデルは、これらのタグを認識したり、完全にスキップしたりすることができませんでした。
ラップ歌詞のようなリズミカルに複雑なコンテンツを使用しても、DIAはテンポを維持するパフォーマンススタイルのスピーチを生成します。これは、ElevenLabsおよびSesameの1Bモデルからのより単調または切り離された出力とは対照的です。
オーディオプロンプトを使用して、DIAはスピーカーの音声スタイルを新しいラインに拡張または継続できます。シードとして会話のクリップを使用する例は、DIAがスクリプト化されたダイアログの残りの部分を通じてサンプルから声の特性をどのように運ぶかを示しました。この機能は、他のモデルでは堅牢にサポートされていません。
1つのテストのセットで、Nari Labsは、Sesameの最高のWebサイトデモが、パブリック1Bチェックポイントではなく、内部8Bバージョンのモデルを使用している可能性が高いと述べ、広告と実際のパフォーマンスのギャップが生じました。
モデルアクセスと技術仕様
開発者は、Nari LabsからDIAにアクセスできます GitHubリポジトリ そしてその 顔モデルページを抱き締める。
このモデルは、Pytorch 2.0+およびCuda 12.6で実行され、約10GBのVRAMが必要です。
NVIDIA A4000のようなエンタープライズグレードのGPUへの推論は、約40トークンあたり約40トークンを提供します。
現在のバージョンはGPUでのみ実行されますが、NARIはCPUサポートとアクセシビリティを改善するための量子化リリースを提供する予定です。
スタートアップは、展開をさらに合理化するためのPythonライブラリとCLIツールの両方を提供します。
DIAの柔軟性は、コンテンツの作成から支援技術や合成ナレーションまで、ユースケースを開きます。
Nari Labsは、リミックスまたは生成された会話を共有しようとするカジュアルユーザーを対象としたDIAの消費者版も開発しています。興味のあるユーザー 早期アクセスのためにウェイトリストに電子メールで歌うことができます。
完全にオープンソース
モデルはaの下で配布されます 完全にオープンソースApache 2.0ライセンス、つまり、商業目的で使用できることを意味します。これは、企業やインディーアプリ開発者に明らかにアピールするものです。
NARI Labsは、個人へのなりすまし、誤った情報の広がり、または違法行為への関与を含む使用法を明示的に禁止しています。チームは責任ある実験を奨励し、非倫理的な展開に対して姿勢をとっています。
DIAの開発クレジットは、Google TPU Research Cloud、FaceのZerogpu Grantプログラムを抱きしめ、SoundStorm、Parakeet、およびDecript Audio Codecに関する以前の作業からのサポートを提供しています。
Nari Labs自体は、フルタイムとパートタイムの1人(フルタイムと1人のエンジニア)のみで構成されていますが、Discord ServerとGithubを介してコミュニティの貢献を積極的に招待しています。
表現力のある品質、再現性、オープンアクセスに明確に焦点を当てているDIAは、生成音声モデルの風景に独特の新しい声を追加します。
毎日VBでのビジネスユースケースに関する毎日の洞察
上司を感動させたい場合は、VB Dailyがカバーしています。規制上のシフトから実際の展開まで、企業が生成AIで行っていることについて内部のスクープを提供するので、最大のROIの洞察を共有できます。
購読してくれてありがとう。こちらのVBニュースレターをご覧ください。
エラーが発生しました。
#DIAと呼ばれる新しいオープンソースのテキストからスピーチへのモデルが到着しElevenLabsOpenaiなどに挑戦するために到着しました