1770349614
2026-02-06 02:41:00
Apple は、生成 AI がアプリ開発パイプラインをどのように改善できるかを探求し続けています。彼らが見ているのはこれです。
ちょっとした背景
数か月前、Apple 研究者チームは、機能的な UI コードを生成するための AI のトレーニングに関する興味深い研究を発表しました。
この調査では、デザインの品質よりも、AI が生成したコードが実際にコンパイルされ、インターフェイスがどのような動作をするか、どのように見えるかという点でユーザーのプロンプトとほぼ一致しているかどうかを確認することに焦点を当てました。
その結果、オープンソース モデルのファミリーである UICoder が誕生しました。詳細については、こちらをご覧ください。 ここ。
新しい研究
さて、UICoder を担当するチームの一部が「」というタイトルの新しい論文を発表しました。デザイナーのフィードバックによるユーザー インターフェイス生成モデルの改善」
その中で研究者らは、既存のヒューマンフィードバックからの強化学習(RLHF)手法は、「デザイナーのワークフローとうまく整合しておらず、UIデザインを批判し改善するために使用される豊富な理論的根拠を無視している」ため、適切に設計されたUIを確実に生成するようにLLMを訓練するための最良の方法ではないと説明している。
この問題に取り組むために、彼らは別のルートを提案しました。彼らは、プロのデザイナーに、コメント、スケッチ、さらには実践的な編集を使用して、モデルで生成された UI を直接批評および改善させ、その前後の変更をモデルの微調整に使用するデータに変換しました。
これにより、具体的なデザインの改善に基づいて報酬モデルをトレーニングすることができ、現実世界のデザイン判断をよりよく反映したレイアウトとコンポーネントを優先するように UI ジェネレーターに効果的に教えることができました。

セットアップ
合計 21 人のデザイナーが調査に参加しました。
採用された参加者は、2 年から 30 年以上まで、さまざまなレベルの専門的なデザイン経験を持っていました。参加者は、UI/UX デザイン、プロダクト デザイン、サービス デザインなど、さまざまなデザイン分野にも取り組みました。参加したデザイナーは、仕事の中でデザインレビュー(公式および非公式の両方)を実施する頻度も指摘しており、その頻度は数か月に1回から週に複数回までさまざまです。
研究者らは 1,460 個の注釈を収集し、それらをペアの UI の「好み」サンプルに変換し、元のモデルで生成されたインターフェイスとデザイナーが改良したバージョンを対比させました。
これは、UI ジェネレーターを微調整するための報酬モデルをトレーニングするために使用されました。
報酬モデルは、i) レンダリングされたイメージ (UI スクリーンショット)、および ii) 自然言語記述 (UI のターゲット記述) を受け入れます。これら 2 つの入力は、数値スコア (報酬) を生成するためにモデルに入力されます。数値スコア (報酬) は、より高品質のビジュアル デザインがより大きなスコアをもたらすように調整されます。 HTML コードに報酬を割り当てるには、セクション 4.1 で説明した自動レンダリング パイプラインを使用し、まずブラウザー自動化ソフトウェアを使用してコードをスクリーンショットにレンダリングしました。

ジェネレーター モデルに関しては、Apple は Qwen2.5-Coder を UI 生成の主要なベース モデルとして使用し、その後、同じデザイナーがトレーニングした報酬モデルをより小規模で新しい Qwen バリアントに適用して、このアプローチがさまざまなモデル サイズやバージョン間でどの程度一般化されるかをテストしました。
興味深いことに、この研究の著者自身が指摘しているように、そのフレームワークは最終的に従来の RLHF パイプラインによく似ています。違いは、学習シグナルがサムアップ/ダウンや単純なランキング データとしてではなく、デザイナーネイティブのワークフロー (コメント、スケッチ、実践的な修正) から得られることだと彼らは主張しています。
結果
それで、実際にうまくいきましたか?研究者らによると、答えは「はい」ですが、重要な注意点があります。

一般に、デザイナーネイティブのフィードバック (特にスケッチと直接リビジョン) に基づいてトレーニングされたモデルは、ベース モデルと、従来のランキングまたは評価データのみを使用してトレーニングされたバージョンの両方よりも、著しく高品質の UI デザインを生成しました。
実際、研究者らは、最もパフォーマンスの高いモデル (スケッチ フィードバックで微調整された Qwen3-Coder) が GPT-5 よりも優れていると指摘しました。おそらくもっと印象的なのは、これが最終的にデザイナーからのわずか 181 のスケッチ注釈から導き出されたということです。
私たちの結果は、スケッチベースの報酬モデルを使用した微調整が、テストされたすべてのベースラインの UI 生成機能の向上に一貫してつながったことを示しており、一般化可能性を示唆しています。また、少量の質の高い専門家からのフィードバックにより、UI 生成において小規模なモデルが大規模な独自の LLM よりも効率的にパフォーマンスを向上できることも示します。

注意点として、研究者らは、正確に何が優れたインターフェースを構成するかということに関しては、主観が大きな役割を果たしていると指摘しました。
私たちの仕事やその他の人間中心の問題における大きな課題の 1 つは、設計上の問題の主観性と複数の解決策を処理することです。どちらの現象も応答に大きなばらつきを引き起こす可能性があり、広く使用されているランキングのフィードバック メカニズムに課題をもたらします。
研究では、この差異は、どちらの設計が実際に優れているかについての意見の相違として現れました。研究者がデザイナーがランク付けしたのと同じ UI ペアを独自に評価したところ、デザイナーの選択に同意したのは 49.2% の確率で、ほとんどコイン投げ程度でした。
一方、デザイナーが改善点をスケッチしたり、UI を直接編集したりしてフィードバックを提供した場合、研究チームはそれらの改善点に同意する割合がはるかに高く、スケッチについては 63.6%、直接編集については 76.1% でした。
言い換えれば、デザイナーが単に 2 つの選択肢から選ぶのではなく、何を変更したいのかを具体的に示すことができれば、「より良い」とは実際に何を意味するのかについて合意することが容易になりました。
より技術的な側面、トレーニング資料、インターフェイスのその他の例など、研究をさらに詳しく調べるには、 このリンクをたどってください。
Amazonでのアクセサリーセール


FTC: 当社は収入を得る自動アフィリエイト リンクを使用しています。 もっと。

#Appleの新たな研究でデザイナーがAIに優れたUIを生成するよう教える