1744449741
2025-04-12 09:16:00
主な情報
- 生成AIは、人間のプログラマーにとって簡単なタスクのデバッグデバッグを実行するのに問題があります。
- 研究者たちは、最も効率的なモデルでさえ、SWEベンチライトで48.4%の成功率のみを取得していることを発見しました。これはデバッグの観点からの現在の参照です。
- 大規模な言語モデルの改良と「情報検索」モデルの開発は、インタラクティブなIAデバッグ能力を改善できますが、追加の作業が必要です。
プログラミングにおける生成AIの統合が拡大しているにもかかわらず、によって新しい研究が行われました マイクロソフト 重要な制限を強調してください。これらのモデルは、経験豊富な人間のプログラマーにとって比較的簡単なデバッグタスクを実行するのに苦労しています。 AIがコード生成の観点から有望である場合、エラーを識別および修正する能力は未発達のままです。
Microsoftの研究者が実施したこの研究では、デバッグの観点から一般的な参照であるSWE-Bench Liteで9つの異なるAIモデルをテストしました。 Claude 3.7 Sonnetは、最高の成功率(48.4%)を獲得しましたが、これはまだ実用的なアプリケーションでは満足のいくものではありません。の他のモデルOpenai さらに平凡な結果を得ています。
新しいモデルの開発
研究者は、この最適下のパフォーマンスを、効果的なデバッグのための重要なシーケンシャルな意思決定プロセスを反映するトレーニングデータの不足に起因すると考えています。彼らは、これらの大規模な言語モデルを改良することで、インタラクティブなデバッグ能力を改善することができ、現在、バグの解決に必要な情報を収集するために設計された「情報検索」モデルを開発していると考えています。それまでの間、彼らはAIのエージェントがコードとツールと対話できるようにするプラットフォームである「Debug-Gym」を開くことを計画しています。
AIによって生成されたコードの制限
AIコーディングの支援は有望ですが、この研究は、開発者の仕事の流れに対する現在の影響が過大評価される可能性があることを示唆しています。研究者は、デバッグが開発者の重要な部分を占めることを指摘しています。これは、AIがコード生成に役立つ場合でも、全体的な時間節約が最小限に抑えることができることを意味します。
以前の研究では、AIによって生成されたコードの限界も明らかになりました。これは、プログラミングロジックの理解の弱点による安全上の欠陥とエラーを特定することがよくあります。 Microsoftのこの検索では、AIモデルのこの永続的な課題の詳細な調査を提供します。これにより、開発者と意思決定者がより慎重にコーディングにおいてAIの役割にアプローチすることが促進されます。
#生成AIはコードのデバッグにまだ苦労しています