1766739695
2025-12-19 16:00:00
クレジット: AI 生成画像
生成型 AI は、私たちが想定しているほど創造的ではない可能性があります。雑誌への掲載 パターン研究者らは、画像生成AIと画像記述AIが同じ説明シーンを行き来すると、すぐに主題から逸れてしまうことを示しました。
AI ペアは、100 の多様なプロンプトから、ゴシック様式の大聖堂、自然の風景、スポーツの画像、嵐の灯台など 12 のテーマを一貫して決定しました。これら 繰り返されるテーマ おそらく、モデルのトレーニング データのバイアスを反映していると思われます。このデータは、私たちが人間として写真を撮ることに決めたもので構成されています。
「現時点での AI の創造性は、おそらくかなり限られていると思います。私たちの実験で AI が生成したものは、当たり障りのない、ポップ カルチャーで、ありきたりなものです」とスウェーデンのダーラナ大学の責任著者アーレンド・ヒンツェ氏は言う。 「それは、私たち人間が創造的だと考えるものとはほぼ逆です。彼らはピカソのゲルニカを作るつもりはありません。なぜなら、それには多くの意図性と創造的なインプットが必要だからです。」
テレビ電話で AI の創造性をテストする
AI モデルは、人間の入力なしで独自の出力、または他の AI によって作成された出力を生成、評価、修正できる独立したエージェントとしてますます推進されています。しかし、著者らは、AI は人間の介入なしで仕事を続けることができるのか、AI は自分のデバイスに任せたときにどれほど創造性を発揮できるのか、と疑問に思いました。
これらの質問に答えるために、研究者らは AI モデルのペアに視覚的な「電話」のゲームをプレイするよう依頼しました。彼らは、検索アルゴリズムを使用して、最長 30 単語の長さのテーマ別に多様な説明プロンプトを 100 個生成しました。たとえば、「自然に囲まれて特に一人で座っていたとき、忘れられた言語で物語が語られ、読まれて理解されるのを待っていたちょうど 8 ページの古い本を見つけました。」
次に、彼らは尋ねました。 画像生成AI Stable Diffusion XL と呼ばれるプロンプトの 1 つに基づいてイメージを生成します。この画像は、LLaVA と呼ばれる大型言語 AI に渡され、画像生成 AI に戻される前に画像が記述されました。
「おそらく少し落ち着いた後、画像は私たちが設定したプロンプトとほぼ一致した状態を保つだろうと予想していました」とヒンツェ氏は言います。 「つまり、村がある山のイメージを一貫して生成するのはどれほど難しいでしょうか?」
AI モデルが元のプロンプトからどのように逸脱するか
しかし、彼らの合格後、 画像と説明 100 回行ったり来たりすると、プロンプトが何を説明したかに関係なく、AI モデルは一貫して元のプロンプトから遠ざかってしまいました。収束は、研究者がより長く、より精巧な初期プロンプトを使用した場合や、モデルの設定を変更して各決定に高度なランダム性を組み込んだ場合にも発生しました。
たとえば、「首相は戦略文書を熟読し、差し迫った軍事行動のさなか仕事の重みをやりくりしながら、脆弱な和平協定を国民に売り込もうとしている」というプロンプトから、AIモデルは当初、スーツを着た男性が新聞用紙に重ねられた定型化された画像を生成したが、その34番目の画像では古典的な図書館が描かれ、100回目のループまでにAIは赤いソファとカーテンのある豪華なリビングルームに落ち着いた。
最終的な画像の内容を分析した後、研究者らは、スポーツ画像、都市の夜景、素朴な建築空間など、AI が繰り返し収束した 12 のテーマを特定しました。
研究者らが 4 つの異なる画像生成 AI モデルと 4 つの異なる画像記述モデルを使用してタスクを繰り返したときにも、同じ収束パターンが現れました。より長く、より複雑な初期プロンプトを使用した場合。そして、各決定に高度なランダム性を組み込むためにモデルの設定を変更したとき。
「これはかなりの程度、データセットの偏りから来ていると思います」とヒンツェ氏は言う。 「これらの AI は何百万もの画像で訓練されており、それらの画像の共通点は私たちが写真を撮るものです。」
AIの創造性と多様性への影響
研究者らがモデルを最大 1,000 回の往復で長いループで実行したところ、画像は約 100 ループ後に一貫性が得られましたが、数百ループ後に突然別の一般的なモチーフに切り替わることがありました。
「これらのモチーフは、一度収束すると非常に安定しますが、1,000 枚の画像を実行すると、離れていきます」とヒンツェ氏は言います。 「一部のモチーフが他のモチーフよりも安定しているかどうかは不明です。たとえば、最初は常にスポーツのイメージ、次に馬、そして自然の順になるのでしょうか?」
これらの結果は、AIが文化的適合性を促進するのではなく、創造的な多様性に貢献するのであれば、人間の情報を常に把握しておくことが不可欠である可能性があることを示唆している、と研究者らは述べている。この調査結果はまた、 反収束メカニズム AIモデル内でAIの創造性の能力を向上させると彼らは付け加えた。
「創造性とは 2 つのことだと思います。新しいものを生み出すこと、そしてフィルターを使って、これは面白い、これは美しい、これは刺激的、これはエキサイティングであると判断することです」とヒンツェ氏は言います。
「現時点では、AI は最初の部分では非常に優れていますが、2 番目の部分では非常に苦手です。今後もそうなるとは限りません。適切にプロンプトと準備が整えられている限り、AI はおそらく将来、非常に優れた自動生成のものを作成できるようになると思います。」
詳細情報:
自律的な言語と画像の生成ループが一般的な視覚モチーフに収束します。 パターン (2025年)。 DOI: 10.1016/j.patter.2025.101451。 www.cell.com/patterns/fulltext … 2666-3899(25)00299-5
引用: 生成 AI は視覚的な「電話」のゲームで失敗する (2025 年 12 月 19 日) https://techxplore.com/news/2025-12-generative-ais-game-visual.html より 2025 年 12 月 26 日に取得
この文書は著作権の対象です。個人的な研究や研究を目的とした公正な取引を除き、書面による許可なしにいかなる部分も複製することはできません。コンテンツは情報提供のみを目的として提供されています。
#生成型 #は視覚的な電話ゲームでは失敗する