日本語版
最新ニュース
科学&テクノロジー

Qwen-Image Edit は、数秒で機能する AI を活用したテキストから画像への編集により、Photoshop をコストパフォーマンスに優れたものにします。

によると、Adobe Photoshop は、これまでに作成されたソフトウェアの中で最もよく知られており、世界中のクリエイティブなプロフェッショナルの 90% 以上が使用しています。 写真。つまり、 新しいオープンソース AI モデル — Qwen-画像編集中国の電子商取引大手アリババのAI研究者クウェンチームが昨日発表した――は テキスト入力だけで膨大な数の Photoshop のような編集ジョブを実行できるようになりました、注目すべき成果です。200億のパラメータに基づいて構築 今月初めにリリースされた Qwen-Image 基盤モデルQwen-Image-Edit は、テキスト レンダリングにおけるシステムの独自の強みを拡張し、微妙な外観の変更から広範な意味の変換に至るまで、幅広い編集タスクをカバーします。開始画像をアップロードするだけです — 私は自分自身の画像の 1 つを試してみました VentureBeat の最後の年次変革カンファレンス サンフランシスコ — 次に、変更したい内容の指示を入力すると、Qwen-Image-Edit がそれらの編集が適用された新しい画像を返します。入力画像例:写真提供: Michael O'Donnell Photographyプロンプト付きの出力画像の例: 「タキシードを着た男性を作成します。」このモデルは現在、以下を含むいくつかのプラットフォームで利用できます。 クウェンチャット、 ハグフェイス、 モデルスコープ、 GitHub、そしてそれを通して Alibaba…

Qwen-Image Edit は、数秒で機能する AI を活用したテキストから画像への編集により、Photoshop をコストパフォーマンスに優れたものにします。

1761552624
2025-08-19 20:27:00

によると、Adobe Photoshop は、これまでに作成されたソフトウェアの中で最もよく知られており、世界中のクリエイティブなプロフェッショナルの 90% 以上が使用しています。 写真

つまり、 新しいオープンソース AI モデル Qwen-画像編集中国の電子商取引大手アリババのAI研究者クウェンチームが昨日発表した――は テキスト入力だけで膨大な数の Photoshop のような編集ジョブを実行できるようになりました、注目すべき成果です。

200億のパラメータに基づいて構築 今月初めにリリースされた Qwen-Image 基盤モデルQwen-Image-Edit は、テキスト レンダリングにおけるシステムの独自の強みを拡張し、微妙な外観の変更から広範な意味の変換に至るまで、幅広い編集タスクをカバーします。

開始画像をアップロードするだけです — 私は自分自身の画像の 1 つを試してみました VentureBeat の最後の年次変革カンファレンス サンフランシスコ — 次に、変更したい内容の指示を入力すると、Qwen-Image-Edit がそれらの編集が適用された新しい画像を返します。

入力画像例:

写真提供: Michael O’Donnell Photography

プロンプト付きの出力画像の例: 「タキシードを着た男性を作成します。」

このモデルは現在、以下を含むいくつかのプラットフォームで利用できます。 クウェンチャットハグフェイスモデルスコープGitHub、そしてそれを通して Alibaba Cloud アプリケーション プログラミング インターフェイス (API)後者では、サードパーティの開発者や企業がこの新しいモデルを独自のアプリケーションやワークフローに統合できるようになります。

上記の例を作成しました クウェンチャット、Qwen Team の OpenAI の ChatGPT のライバルですが、意欲的なユーザーは、世代がリセットされるまでの無料ジョブ (入力/出力) が 12 時間あたり約 8 個に制限されることに注意する必要があります。有料ユーザーはより多くの求人にアクセスできます。

英語と中国語の両方の入力をサポートし、意味論的な意味と視覚的な忠実度の両方に重点を置いた Qwen-Image-Edit は、プロレベルのビジュアル コンテンツ作成への障壁を下げることを目指しています。

そして、モデルがオープンソース コードとして利用可能であることを考えると、 Apache 2.0 ライセンスに基づいて企業にとっては、自社のハードウェアまたは仮想クラウド/マシン上で無料で取得、ダウンロード、セットアップすることが安全であり、Photoshop などの独自ソフトウェアに比べて大幅なコスト削減につながる可能性があります。

として Qwen Team 研究者の Junyang Lin 氏は X について、「髪の毛を 1 本も除去することができ、非常に繊細な画像修正が可能である」と書いています。

チームの発表はこの意見を反映しており、Qwen-Image-Edit をまったく新しいシステムとしてではなく、独自のテキスト レンダリングとデュアル エンコーディングのアプローチを編集タスクに直接適用する Qwen-Image の自然な拡張機能として提示しています。

デュアルエンコーディングにより、元の画像のスタイルとコンテンツを維持したまま編集できます

Qwen-Image-Edit は、によって確立された基盤の上に構築されています。 クウェンの画像は、画像生成とテキスト レンダリングの両方に特化した大規模モデルとして今年初めに導入されました。

Qwen-Image の技術レポートでは、段落レベルのテキストのレンダリング、中国語と英語の文字、複数行のレイアウトなどの複雑なタスクを正確に処理する能力を強調しています。

報告書はまた、次のことを強調しました。 デュアルエンコーディング機構、セマンティック制御のために画像を Qwen2.5-VL に同時に供給し、詳細を再構成するために変分オートエンコーダー (VAE) に供給します。このアプローチにより、プロンプトの意図と元の画像の外観の両方に忠実な編集が可能になります。

これらと同じアーキテクチャ上の選択が Qwen-Image-Edit を支えています。デュアル エンコーディングを活用することで、モデルは次の 2 つのレベルで調整できます。 セマンティック編集 シーンの意味や構造を変えるもの、そして 外観の編集 要素を導入または削除し、残りの要素はそのままにします。

セマンティック編集 これには、新しい知的財産の作成、オブジェクトを 90 度または 180 度回転してさまざまなビューを表示すること、または入力をスタジオ ジブリにインスピレーションを得たアートなどの別のスタイルに変換することが含まれます。これらの編集では通常、多くのピクセルが変更されますが、オブジェクトの基礎となるアイデンティティは保持されます。

こちらです セマンティック編集の例 AI アプリケーション プラットフォーム Replicate のエンジニアである Shridhar Athirayanan 氏は、Replicate がホストする Qwen の実装または「推論」を使用して、マンハッタンの写真をおもちゃのレゴ セットのように見せるためにスキンを変更しました。

外観編集 正確な局所的な変更に焦点を当てます。このような場合、特定のオブジェクトが変更されても、画像の大部分は変更されません。デモには、水の反射を生成する看板の追加、肖像画からの髪の毛の束の除去、テキスト画像内の 1 つの文字の色の変更などが含まれます。

Qwen-Image Edit を使用した外観編集の良い例の 1 つは、AnswerAI の共同創設者兼 CEO の Thomas Hill 氏によるものです。 X 上に並んで アーチ道の下にウェディングドレスを着た妻と、落書きで覆われた同じアーチ道を持つ別の妻を示しています。

中国語と英語のテキストのレンダリングにおける Qwen の確立された強みと組み合わせることで、編集に重点を置いたシステムは、単純な生成イメージ以上のものを必要とするクリエイターにとって柔軟なツールとして位置づけられています。

セマンティック スコープと外観の忠実度を二重に制御することにより、クリエイティブな IP 開発からプロダクション レベルの写真レタッチまで、同じツールでさまざまなニーズに対応できることになります。

画像へのテキストの追加または削除

もう一つの傑出した能力は、 バイリンガルテキスト編集。 Qwen-Image-Edit を使用すると、フォント、サイズ、スタイルを維持しながら、中国語と英語の両方のテキストを追加、削除、または変更できます。

これは、特に複雑な漢字などの難しいシナリオにおいて、強力なテキスト レンダリングに対する Qwen-Image の評判をさらに拡張します。

実際には、これにより、以下に示すように、小さなテキストの詳細が重要なポスター、看板、T シャツ、またはカリグラフィー アートワークを正確に編集できます。 以下の Replicate の別の例

1 つのデモンストレーションでは、段階的に連鎖した編集プロセスを通じて、生成された中国の書道の一部のエラーを修正することが含まれていました。

ユーザーは、間違った領域を強調表示し、それを修正するようにシステムに指示し、正しい文字がレンダリングされるまで詳細をさらに調整することができます。この反復的なアプローチは、精度が重要な一か八かの編集タスクにモデルをどのように適用できるかを示します。

アプリケーションとユースケース

Qwen チームは、さまざまな潜在的なアプリケーションを強調しました。

  • クリエイティブなデザインとIPの拡張、マスコットベースの絵文字パックの生成など。

  • 広告とコンテンツの制作、ロゴ、看板、テキストの多いビジュアルをカスタマイズできます。

  • バーチャルアバターとアート、独自の文字表現をサポートするスタイル転送を備えています。

  • 写真撮影と個人使用、背景の調整、服装の変更、オブジェクトの削除など。

  • 文化の保存、古典的な書道作品の修正を通じて実証されました。

Qwen-Image-Edit は、きめ細かい編集とより広範なクリエイティブな変換を橋渡しすることで、カジュアルな実験に親しみやすいものでありながら、コントロールを必要とする専門家に応えます。

ベンチマークとパフォーマンス

Qwen チームによると、公開ベンチマーク全体の評価では、Qwen-Image-Edit が優れた性能を発揮することが示されています。 最先端のパフォーマンス 画像編集中。

これは、基本モデルが一般的な画像生成タスクとテキスト レンダリング タスクの両方で優れた結果を達成した、より広範な Qwen-Image 技術評価に続くものです。

特定の編集ベンチマークの数値はリリースでは詳しく説明されていませんでしたが、Qwen-Image 自体は、人間の評価者がさまざまなプロバイダーのモデル間で出力を比較する AI Arena などの独立した評価で上位にランクされました。

API の価格と可用性

を通して アリババクラウドモデルスタジオ、開発者は API として Qwen-Image-Edit にアクセスできます。価格設定は 画像あたり 0.045 ドル、無料割り当ては 100 枚の画像が 180 日間有効 アクティベーション後。

このサービスは当初、 シンガポール地域、レート制限は 1 秒あたり 5 つのリクエスト そして最大まで アカウントごとに 2 つの同時タスク

API を使用するには、開発者は Model Studio API キーを取得する必要があり、HTTP 経由または Python または Java の DashScope SDK 経由でモデルを呼び出すことができます。

画像は URL または Base64 形式で送信でき、サポートされる解像度は 512 ~ 4,096 ピクセル、ファイル サイズは最大 10 MB です。出力イメージは、24 時間有効なリンクとともに Alibaba Cloud Object Storage でホストされるため、ユーザーは結果をすぐにダウンロードして保存する必要があります。

クウェンの次は何でしょうか?

Qwen は Image Edit をその一歩として位置付けていますd ビジュアルコンテンツ作成の障壁を下げる。 正確でスタイルの一貫した編集をよりアクセスしやすくすることで、モデル デザイン スタジオから個人プロジェクトを洗練するカジュアル ユーザーまでのアプリケーションをサポートできます。

このシステムは、AI 開発におけるより広範なトレンド、つまり単一目的の生成を超えて、編集、修正、改良を統合したツールへの移行を示唆しています。

セマンティックな柔軟性と外観レベルの精度の両方を備えた Qwen-Image-Edit は、この変化を反映し、大規模モデルの生成力とプロの編集に必要な信頼性を融合させています。

#QwenImage #Edit #は数秒で機能する #を活用したテキストから画像への編集によりPhotoshop #をコストパフォーマンスに優れたものにします

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。