1727355540
2024-09-26 11:26:50
マドリード、9月26日(Portaltic/EP) –
メタは、 最初のマルチモーダル言語モデル Llama 3.2画像とテキストの両方を処理できる小型・中型モデルの11Bと90Bと、軽量のテキスト専用モデル1Bと3Bで構成されています。
イベントの枠組みの中で メタコネクト2024このテクノロジー企業は、新しい言語モデルを含む最新の開発成果を発表した。これは、 ラマ 3.1同社初となる画像処理機能を導入しました。
したがって、新しいラマ3.2モデルは 2つの小規模および中規模のマルチモーダルモデル、 それぞれ110億のパラメータ(11B)と900億のパラメータ(90B)を持つ。この意味で、これらの新しいモデルの使用例は 絵による推論、 どうしてそうなるのでしょうか? グラフや図、画像のキャプションを理解するまた、画像内の物体の方向の位置も処理します。
つまり、このモデルでは次のようなアクションを実行できます。 写真から詳細を抽出し、シーンを理解して文章を作成する 画像のタイトルやストーリーを伝えるきっかけとして使用できます。
同様に、Llama 3.2は 2つの小型モデル、1Bと3B、 何 テキストのみを処理する スマートフォンなどのデバイスで動作するように設計されており、これらのモデルは ARMプロセッサ そして彼らは解決できる 最小限の遅延でマルチタスクまた、コンテキストの長さもサポートしています。 128,000トークン。
具体的には、これらのモデルにより、開発者はデバイス上でカスタムアプリケーションを作成し、スマートフォンや製品内でデータがプライベートに保たれることを保証することができます。たとえば、Metaは、 受信した最後の10件のメッセージの要約を実行するために使用されます インスタントメッセージングアプリでも使用できます。 会議を整理するためにカレンダーの招待状を自動的に送信します。
しかし、このテクノロジー企業は、これらのモデルが何よりも優れている点として、 ローカルで実行できる機能この機能により、モデルの指示や応答はローカルで処理されるため、瞬時に実行できます。また、メッセージやカレンダー情報などのデータはクラウドに送信されないため、完全なプライバシーが保証されます。
CLAUDE 3 HAIKU GPT4O-MINIと競合
Metaが提供するこれらのモデルの評価によると、モデル3.2 11Bと90Bは 主要なエントリーレベルモデルであるClaude 3 HaikuおよびGPT4o-miniと競合 画像認識やさまざまな視覚理解タスクにおいて。
一方、3Bモデルは他のモデルよりも優れている。 ジェマ2 2.6Bとファイ3.5分 指示に従う、要約する、指示を書き直す、ツールを使用するなどのタスクを実行するとき。同様に、モデル 1B はこの領域では Gemma と似ています。
これらの結論に至るために、メタ 150以上のベンチマークデータセットでモデルのパフォーマンスを評価した多種多様な言語をカバーしています。
同社は、オープンソースのLlama 3.2大規模言語モデルが すべての開発者に利用可能になりましたそうすれば、その可能性をテストし、実験し始めることができる。また、 これらすべての機能は、AI アシスタントの Meta AI に組み込まれています。
#Meta #が初のオープンソース #マルチモーダル言語モデル #Llama #を発表