日本語版
最新ニュース
科学&テクノロジー

OpenaiはついにGPT-5を発売しました。これがあなたが知る必要があるすべてです

Openaiのブログ投稿では、GPT-5は、SWEベンチ検証(スコア74.9%)、SWEランサー(GPT-5思考の記録55%)、エイダーポリグロット(88%の得点)を含む、いくつかのコーディングベンチマークで以前のモデルを破っていると主張しています。水曜日の記者会見の中で、Openai後のトレーニング後のリードYann Duboisは、GPT-5に「私のパートナーである英語話者のためにフランス語を学ぶために、美しい、非常にインタラクティブなWebアプリを作成する」ように促しました。彼はAIに、毎日の進捗状況、フラッシュカードやクイズなどのさまざまなアクティビティなどの機能を含めるように任命し、アプリを「非常に魅力的なテーマ」にまとめたいと思っていることに注目しました。 1分ほど後、AIに生成されたアプリが表示されました。それはたった1つの鉄道上のデモでしたが、結果はデュボアが求めたものを正確に提供する洗練されたサイトでした。「これは素晴らしいコーディングコラボレーターであり、エージェントタスクにも優れています」と、トレーニング後のリードであるミシェル・ポクラスは言います。 「長いチェーンとツールコールを効果的に実行します [which means it better understands when and how to use functions like web browsers or external APIs]、詳細な指示に従い、その行動の前払いを提供します。」Openaiはまた、ブログの投稿で、GPT-5は「健康関連の質問にこれまでで最高のモデル」であると述べています。 3つのOpenAIヘルス関連のLLMベンチマーク(Healthbench、Healthbench Hard、Healthbench Consensus)システムカード (製品の技術的能力やその他の調査結果を説明するドキュメント)は、GPT-5を考えていることが以前のモデルを「かなりのマージンで」よりも優れていると述べています。 GPT-5の思考バージョンは、O3の31.6%のスコアから、Healthbenchで25.5%を獲得しました。システムカードによると、これらのスコアは2人以上の医師によって検証されています。Pokrassによると、このモデルは幻覚が少ないと言われています。Pokrassは、誤った情報を提供するAIの一般的な問題です。 Openaiの安全調査のリードAlex Beutelは、「GPT-5の欺ceptionの割合が大幅に低下した」と付け加えました。「私たちの緩和は完璧ではなく、より多くの研究が必要であるが、GPT-5考えの欺、che、またはハッキングの傾向を減らすための措置を講じました」とシステムカードは言います。 「特に、解決できないタスクでポーズをとると、モデルを優雅に失敗するようにトレーニングしました。」同社のシステムカードによると、WebブラウジングにアクセスできないGPT-5モデルをテストした後、研究者は幻覚率(「マイナーまたは主要なエラーを含む事実上の主張の割合」と定義されている)をGPT-4Oモデルよりも26%少ないことを発見したと述べています。 GPT-5考えは、O3と比較して幻覚率が65%減少しています。二重使用(潜在的に有害または良性)である可能性のあるプロンプトの場合、BeutelはGPT-5が「安全な完了」を使用していると言います。 Beutelによると、Openaiは5,000時間以上の赤いチームを行い、外部組織でテストしてシステムが堅牢であることを確認しました。Openai氏によると、APIを利用して、CHATGPT、500万人の有料ビジネスユーザー、400万人の開発者の週7億人近くのアクティブユーザーを誇っています。「このモデルの雰囲気は本当に良いです。人々は本当にそれを感じるだろうと思います」とChatGptニック・ターリーの責任者は言います。 「特に、モデルについて考えて時間を費やしていない平均的な人々。」 #OpenaiはついにGPT5を発売しましたこれがあなたが知る必要があるすべてです

OpenaiはついにGPT-5を発売しました。これがあなたが知る必要があるすべてです

1754591275
2025-08-07 17:00:00

Openaiのブログ投稿では、GPT-5は、SWEベンチ検証(スコア74.9%)、SWEランサー(GPT-5思考の記録55%)、エイダーポリグロット(88%の得点)を含む、いくつかのコーディングベンチマークで以前のモデルを破っていると主張しています。

水曜日の記者会見の中で、Openai後のトレーニング後のリードYann Duboisは、GPT-5に「私のパートナーである英語話者のためにフランス語を学ぶために、美しい、非常にインタラクティブなWebアプリを作成する」ように促しました。彼はAIに、毎日の進捗状況、フラッシュカードやクイズなどのさまざまなアクティビティなどの機能を含めるように任命し、アプリを「非常に魅力的なテーマ」にまとめたいと思っていることに注目しました。 1分ほど後、AIに生成されたアプリが表示されました。それはたった1つの鉄道上のデモでしたが、結果はデュボアが求めたものを正確に提供する洗練されたサイトでした。

「これは素晴らしいコーディングコラボレーターであり、エージェントタスクにも優れています」と、トレーニング後のリードであるミシェル・ポクラスは言います。 「長いチェーンとツールコールを効果的に実行します [which means it better understands when and how to use functions like web browsers or external APIs]、詳細な指示に従い、その行動の前払いを提供します。」

Openaiはまた、ブログの投稿で、GPT-5は「健康関連の質問にこれまでで最高のモデル」であると述べています。 3つのOpenAIヘルス関連のLLMベンチマーク(Healthbench、Healthbench Hard、Healthbench Consensus)システムカード (製品の技術的能力やその他の調査結果を説明するドキュメント)は、GPT-5を考えていることが以前のモデルを「かなりのマージンで」よりも優れていると述べています。 GPT-5の思考バージョンは、O3の31.6%のスコアから、Healthbenchで25.5%を獲得しました。システムカードによると、これらのスコアは2人以上の医師によって検証されています。

Pokrassによると、このモデルは幻覚が少ないと言われています。Pokrassは、誤った情報を提供するAIの一般的な問題です。 Openaiの安全調査のリードAlex Beutelは、「GPT-5の欺ceptionの割合が大幅に低下した」と付け加えました。

「私たちの緩和は完璧ではなく、より多くの研究が必要であるが、GPT-5考えの欺、che、またはハッキングの傾向を減らすための措置を講じました」とシステムカードは言います。 「特に、解決できないタスクでポーズをとると、モデルを優雅に失敗するようにトレーニングしました。」

同社のシステムカードによると、WebブラウジングにアクセスできないGPT-5モデルをテストした後、研究者は幻覚率(「マイナーまたは主要なエラーを含む事実上の主張の割合」と定義されている)をGPT-4Oモデルよりも26%少ないことを発見したと述べています。 GPT-5考えは、O3と比較して幻覚率が65%減少しています。

二重使用(潜在的に有害または良性)である可能性のあるプロンプトの場合、BeutelはGPT-5が「安全な完了」を使用していると言います。 Beutelによると、Openaiは5,000時間以上の赤いチームを行い、外部組織でテストしてシステムが堅牢であることを確認しました。

Openai氏によると、APIを利用して、CHATGPT、500万人の有料ビジネスユーザー、400万人の開発者の週7億人近くのアクティブユーザーを誇っています。

「このモデルの雰囲気は本当に良いです。人々は本当にそれを感じるだろうと思います」とChatGptニック・ターリーの責任者は言います。 「特に、モデルについて考えて時間を費やしていない平均的な人々。」

#OpenaiはついにGPT5を発売しましたこれがあなたが知る必要があるすべてです

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。