1713091437
2024-04-12 18:47:44
企業がどのように責任を持って AI を本番環境に統合しているかをご覧ください。 SF で開催されるこの招待者限定のイベントでは、テクノロジーとビジネスの交差点を探ります。 参加方法を確認する ここ。
最も機能的なテキストから画像への変換モデルを発表してから 1 か月余り。 表意文字 は、説明ベースの参照や否定的なプロンプトなど、AI にいくつかの新機能を導入するアップデートをプッシュしました。
Ideogram で入手可能 ウェブプラットフォームの機能は、ユーザーが画像の生成方法をより詳細に制御できるようにするとともに、出力の全体的な品質と一貫性を向上させるように設計されています。 サービスを強化し、マーキングします もう一つの注目すべきステップ Midjourney や DALL-E など、画像生成分野における競合製品のパフォーマンスに迫るためです。
これらの機能はすぐにテストできますが、プラットフォームの無料版を使用しているユーザーがすべての機能を利用できるわけではありません。
Ideogram の新機能は何ですか?
Ideogram が 2 月にそのモデルのバージョン 1.0 を発表したとき、ユーザーはマジック プロンプト機能を利用して、ユーザーが入力した内容を展開して詳細を確認できるようになりました。 今回この作品を構築するにあたり、同社は参照画像から説明やキャプションを生成する新しい Describe 機能を導入しました。
基本的に、ユーザーは、Ideogram で生成された公開画像を取得したり、独自の画像をアップロードして、画像のテキストベースの説明を追加したりできるようになりました。 このコンテンツは、非常によく似た画像を生成するためのプロンプトとして使用できます。 必要に応じて、ユーザーは生成された説明を変更して、必要に応じて出力を変更することもできます。
しかし、それだけではありません。
Ideogram には、参照画像の説明に加えて、否定的なプロンプトと、プラットフォーム上で高速、デフォルト、または品質モードのいずれかを選択するオプションが追加されています。 前者は、名前が示すように、ユーザーが否定的なプロンプトを与え、出力に何を見たくないかをモデルに伝えることができます。 ユーザーが特定のオブジェクトを削除したり、世代のスタイルを調整したりできるように設計されています。
一方、後者では、出力が生成される速度をユーザーが制御できるようになります。 Ideogramによると、高速モードは非常に基本的な品質で画像を約5秒で生成するが、高品質モデルはフォトリアリズムと細部に重点を置くが、所要時間は約20秒だという。 デフォルト モードは 2 つのモードの中間に位置し、両方の側面のバランスをとり、約 12 秒かかります。
これらのモードを実際に使用しているユーザーの数はまだわかりませんが、Ideogram によると、ユーザーはこれらのオプションを使用して基本的なイメージを迅速に生成し、それを反復処理して高品質の結果を得ることができます。
フォトリアリズムとテキストレンダリングの向上
最後に、Ideogram は、最新のアップデートでテキストのレンダリングを強化し、エラー率をさらに 15% 削減するとも述べました。 これは大きな変更ではないが、同社によれば、文字や単語を生成する際のパフォーマンスは DALL-3 Vivid よりも優れているという。
Ideogram は、アップグレードされたモデルと比較した統計情報を共有していませんでした。 旅の途中、AI画像生成カテゴリでトップです。 ただし、このモデルは出力で強化された画像の一貫性とフォトリアリズムを提供し、人間の評価者によって最後のバージョンよりも好まれていると主張しました。
「人間の評価者は、迅速な位置合わせ、画像の一貫性、テキスト レンダリングの品質の点で、アップグレードされたモデルで生成された画像を以前のバージョンよりも 30 ~ 50% 高く評価しています」と同社は述べています。 昨年パブリックベータを開始に書きました。 ブログ投稿。
現在、否定的なプロンプトと新しい速度モードは、Ideogram の Basic プランと Plus プランの料金を支払っているユーザーに制限されています。 参照画像のキャプションが利用できるかどうかは明らかではありませんが、ユーザーが既存の参照画像に似た画像を生成できるようにするために同社が提供している Remix 機能とほぼ一致するため、無料である可能性があると思われます。 テキストと画像の一貫性の強化も、あらゆるユーザーが利用できます。
#Ideogram #は説明ベースの参照により #画像ジェネレーターを強化します