日本語版
最新ニュース
科学&テクノロジー

AI画像ジェネレーターのデフォルトは同じ12種類の写真スタイル、研究結果

AI 画像生成モデルには、独自の出力を作成するために大量の視覚データを取得します。それでも研究者らは、モデルがゆっくりと変化する一連のプロンプトに基づいて画像を生成するよう促されると、デフォルトではほんの一握りの視覚的モチーフになり、最終的には一般的なスタイルになることを発見しました。 あ 雑誌に掲載された研究 パターン は、Stable Diffusion XL と LLaVA という 2 つの AI 画像ジェネレーターを使用し、テレビ電話のゲームをプレイしてテストしました。ゲームは次のように進行しました。Stable Diffusion XL モデルには短いプロンプトが与えられ、画像を生成するよう求められます。たとえば、「自然に囲まれて特に一人で座っていたとき、忘れられた言語で物語が書かれ、読まれて理解されるのを待っているちょうど 8 ページの古い本を見つけました。」その画像は LLaVA モデルに提示され、説明を求められました。その後、その説明は Stable Diffusion にフィードバックされ、Stable Diffusion はそのプロンプトに基づいて新しいイメージを作成するように求められました。これを100ラウンド続けました。 © Hintze 他、パターン 人間の電話ゲームと同じように、元の画像はすぐに失われてしまいました。特にこれらのいずれかを見たことがあれば、驚くことではありません タイムラプスビデオ 人々が AI モデルに次のことを依頼する場所 画像を再現する 何も変更を加えないと、写真はすぐにオリジナルとは似ても似つかないものになってしまいます。しかし、研究者らを驚かせたのは、モデルのデフォルト設定がごく少数の一般的なスタイルに過ぎないという事実でした。電話ゲームを 1,000…
お問い合わせ・広告・著作権・不具合に関するご連絡は [email protected] までメールでお願いします。

AI画像ジェネレーターのデフォルトは同じ12種類の写真スタイル、研究結果

AI 画像生成モデルには、独自の出力を作成するために大量の視覚データを取得します。それでも研究者らは、モデルがゆっくりと変化する一連のプロンプトに基づいて画像を生成するよう促されると、デフォルトではほんの一握りの視覚的モチーフになり、最終的には一般的なスタイルになることを発見しました。

雑誌に掲載された研究 パターン は、Stable Diffusion XL と LLaVA という 2 つの AI 画像ジェネレーターを使用し、テレビ電話のゲームをプレイしてテストしました。ゲームは次のように進行しました。Stable Diffusion XL モデルには短いプロンプトが与えられ、画像を生成するよう求められます。たとえば、「自然に囲まれて特に一人で座っていたとき、忘れられた言語で物語が書かれ、読まれて理解されるのを待っているちょうど 8 ページの古い本を見つけました。」その画像は LLaVA モデルに提示され、説明を求められました。その後、その説明は Stable Diffusion にフィードバックされ、Stable Diffusion はそのプロンプトに基づいて新しいイメージを作成するように求められました。これを100ラウンド続けました。

© Hintze 他、パターン

人間の電話ゲームと同じように、元の画像はすぐに失われてしまいました。特にこれらのいずれかを見たことがあれば、驚くことではありません タイムラプスビデオ 人々が AI モデルに次のことを依頼する場所 画像を再現する 何も変更を加えないと、写真はすぐにオリジナルとは似ても似つかないものになってしまいます。しかし、研究者らを驚かせたのは、モデルのデフォルト設定がごく少数の一般的なスタイルに過ぎないという事実でした。電話ゲームを 1,000 回繰り返した結果、研究者らは、ほとんどの画像シーケンスが最終的に 12 の主要なモチーフの 1 つに分類されることを発見しました。

ほとんどの場合、変化は徐々に起こります。何回か、それは突然起こりました。しかし、それはほとんど常に起こりました。そして研究者たちは感銘を受けませんでした。研究では、彼らは一般的な画像スタイルを「ビジュアルエレベーターミュージック」と呼んでおり、基本的にはホテルの部屋に飾られているタイプの写真を指します。最も一般的なシーンには、海上灯台、フォーマルなインテリア、都会の夜の設定、素朴な建築などが含まれます。

研究者らが画像生成と記述のために別のモデルに切り替えた場合でも、同じ種類の傾向が現れました。研究者らによると、ゲームが 1,000 ターンに延長された場合でも、スタイルを中心とした合体は依然として 100 ターンあたりで発生しますが、バリエーションは追加のターンでスピンアウトします。しかし興味深いことに、これらのバリエーションは依然として、人気のある視覚的モチーフの 1 つから引き出されているのが一般的です。

100 回の反復後の AI エンドポイント© Hintze 他、パターン

では、それは何を意味するのでしょうか?ほとんどの場合、AI は特に創造的ではありません。人間が行う電話ゲームでは、各メッセージの伝え方や聞こえ方が異なり、各人が受け取るメッセージに影響を与える可能性のある独自の内部偏見や好みを持っているため、極端なばらつきが生じることになります。 AIには逆の問題があります。元のプロンプトがどれほど突飛なものであっても、デフォルトでは常に限られたスタイルの選択肢が選択されます。

もちろん、AI モデルは人間が作成したプロンプトを利用しているため、データセットと人間が写真を撮るために引き寄せられたものについては言うべきことがあります。ここに教訓があるとすれば、おそらく、スタイルをコピーすることは、センスを教えるよりもはるかに簡単であるということです。


#AI画像ジェネレーターのデフォルトは同じ12種類の写真スタイル研究結果

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。