1708158131
2024-02-17 06:03:56
マルチモーダル LLaVA モデル、カメラ、音声合成の実行
画像提供: Enoc Valenzuela、 アンスプラッシュ
最新の大規模マルチモーダル モデル (LMM) は、テキストだけでなくさまざまな種類のデータも処理できます。 実際、「百聞は一見に如かず」であり、この機能は現実世界とのやり取りにおいて非常に重要になります。 今回の「週末プロジェクト」では、無料の 溶岩 (Large Language-and-Vision Assistant) モデル、カメラ、音声合成装置。 私たちは視覚障害を持つ人々を助けることができる AI アシスタントを作成します。 前のパートと同じように、すべてのコンポーネントはクラウドの費用をかけずに完全にオフラインで実行されます。
早速、本題に入りましょう!
コンポーネント
このプロジェクトでは、いくつかのコンポーネントを使用します。
- あ 溶岩 このモデルは、特別な射影行列を利用して大規模な言語モデルとビジュアル エンコーダーを組み合わせたものです。 これにより、モデルはテキストだけでなく画像プロンプトも理解できるようになります。 私が使用するのは、 コールCpp モデルを実行するためのライブラリ (その名前にもかかわらず、LLaMA だけでなく LLaVA モデルも実行できます)。
- ストリームライト インタラクティブな UI を作成できる Python ライブラリ。 カメラを使用して、画像を撮影し、それについて LMM にさまざまな質問をすることができます (たとえば、モデルに画像について説明するよう求めることができます)。
- あ TTS (テキスト読み上げ) モデルは LMM の回答を音声に変換するため、視覚障害のある人もそれを聞くことができます。 テキスト変換には、 MMS-TTS Facebook 製 (Massively Multilingual Speech TTS) モデル。
約束どおり、リストされているすべてのコンポーネントは無料で使用でき、クラウド API は必要なく、完全にオフラインで動作します。 ハードウェアの観点から見ると、このモデルは Windows または Linux のラップトップまたはタブレットで実行でき (8 GB GPU が推奨されますが、必須ではありません)、UI はスマートフォンを含むあらゆるブラウザーで動作します。
始めましょう。
溶岩
溶岩 (Large Language-and-Vision Assistant) は、視覚と言語の理解を目的としたビジョン エンコーダと LLM を組み合わせたオープンソースの大規模マルチモーダル モデルです。 前にも述べたように、私は コールCpp をクリックしてモデルをロードします。 これ…
#週末 #プロジェクト #視覚障害のある人のための視覚アシスタントを作成 #ドミトリーエリウセフ著 #年 #月