1756879755
2025-09-03 05:17:00
グーグル リリース Gemini 2.5 Flash Image(Nano-Bananaと呼ばれる)、その最新の画像生成および編集モデル。このシステムは、プロンプト間での文字の一貫性、マルチイメージ融合、正確なプロンプトベースの編集、セマンティック理解のための世界知識の統合など、以前のフラッシュモデルにいくつかのアップグレードを導入します。
このリリースは、GoogleのGemini 2.5ファミリーの一部であり、モデルのフラッシュラインをテキストを超えて画像生成に拡張します。 Gemini 2.0フラッシュは、その速度と効率性について主に認識されていましたが、その画像生成の特徴は品質と編集の精度が限られていました。 Gemini 2.5 Flash Imageは、これらの領域に改善をもたらし、迅速な実験と構造化された創造的なワークフローの両方でより実用的なツールを追加します。
Gemini 2.5フラッシュ画像の技術的な焦点の1つは、文字の一貫性であり、生成モデルの一般的な難しさです。たとえば、複数のプロンプトまたは編集で同じ主題を認識できるようにするように設計されています。たとえば、シーン間でキャラクターを移動したり、さまざまな観点から製品を表示したり、標準化された視覚資産を生産したりする場合です。
このモデルは、ユーザーが自然言語の特定の変化を説明できるプロンプトベースの画像編集もサポートしています。一般的な操作には、バックグラウンド調整、オブジェクトの削除または交換、または被験者のポーズなどの詳細の変更が含まれます。さらに、マルチイメージ融合機能により、いくつかの入力の機能を単一の結果に組み合わせることができます。
Gemini 2.5フラッシュイメージは、世界の知識統合の恩恵を受け、セマンティックな推論を必要とするシナリオの優位性を与えます。 Googleは、手描きの図の読み取りや解釈、不動産リストのテンプレートの適応、視覚とテキストの理解を組み合わせた教育タスクの支援などの例を示しています。
工業デザイナーのトーマスブリッジ 共有 モデルをテストした後の彼の第一印象:
自分の画像を編集するのがどれほど良かったかは面白いと思いました。機能の追加、背景/前景などの編集など。また、尋ねられたら「元の画像に戻る」ことができたこともあります。 ChatGptが時々苦労していると思うもの。
このモデルは、Gemini 2.0フラッシュの低レイテンシと効率に基づいて構築され、高品質の出力とより強力な編集制御のためにコミュニティフィードバックを直接組み込みます。現在、プレビューで利用できます Gemini API、 勉強するグーグル、 そして 頂点AI、今後数週間で完全な安定性が予想されます。実験を簡単にするために、Googleは新しいテンプレートアプリケーションでGoogle AI Studioのビルドモードを更新しました。
価格設定は、100万個の出力トークンあたり30ドルで確認されており、各画像の費用は約0.039ドルです。その他のモダリティは、Gemini 2.5フラッシュ価格設定に従います。
#Googleは高度な編集と一貫性のある機能を備えたGemini #2.5フラッシュ画像を起動します