日本語版
最新ニュース
企業

社労士試験を受けたAI「法律知識は難しい」

私たちの実験の結果、Gemini と ChatGPT はそれぞれ 13.5% と 10% という不正解率を記録し、「ひどい成績表」でした。 ▲17日、第24回社会福祉士1級国家資格試験が行われたソウル市内の試験場で試験を終えて帰国する受験者たち。 (イ・ジュノ記者)近年、介護を中心とした社会福祉分野においてもAIやロボットの導入が盛んに行われています。介護人材不足の代替策として、社会資源の無駄を最小限に抑えるために最先端のテクノロジーが導入されているからだ。もし人工知能(AI)が社会福祉士試験を受けたら、どんな結果が出るでしょうか?韓国人材開発院が実施する第24回社会福祉士1級国家資格試験が17日、ソウル市内の各試験場で行われた。この日受験した試験問題を入手し、ChatGPT 5.2とGemini Proの各有料版で、3期にわたって提供された計200問を解いてもらった。この試みは一種の簡易テストであり、その過程で入力されたコマンド(プロンプト)やメソッドに対する学術的なレビューは行われていないため、資格試験の問題の誤りや試験の信頼性を示唆するものではありません。実際、特定のテストにおける AI の「低いスコア」、つまり精度が期待を下回っていることは、すでに何度か証明されています。このことは、昨年11月13日に実施された2026年度大学修学能力試験でも確認された。延世大学人工知能コンバージェンス学部先端コンバージェンス工学科のキム・シホ教授の研究チームは試験直後、ChatGPT(GPT-5)やGemini(2.5Flash)などのAIモデルの無料版を使って学生に2026年CSATの韓国語、英語、数学のセクションを解かせた。研究チームの実験では、ジェミニは韓国語共通領域で76点中42点、チャットGPTで37点を獲得し、数学共通領域では74点中62点、次いで70点を獲得した。英語は100点中63点と86点でした。専門家らは、このレベルではソウルの4年制大学に合格するのは難しいと評価した。Naver CloudとKAISTが発表した論文「韓国教育基準を用いたマルチモーダル生成AIの評価」では、AIモデルはCSATの問題に困難を抱えていることが判明した。論文によると、GPT-4o、Gemini 1.5 Pro、Hyperclova社会福祉士1級国家資格試験の試験の結果、全200問中、ジェミニは不正解が27件で誤答率13.5%、ChatGPTは不正解が20件で10%でした。そこで、誤答を再度チェックしてもらって修正しようとしたところ、Geminiは誤答7件で誤答率3.5%、ChatGPTは誤答10件で誤答率5%でした。興味深いのは、両AIが不正解を主張する問題は少なく、異なる不正解を主張するケースが多かった点だ。 2 つの AI に共通する誤答率は、問題全体のわずか 2% でした。また、3時間目に行われた試験の「社会福祉政策と制度(社会福祉立法論)」では、両AIとも苦戦していることが目立った。最初のテストでは、25 問中、Gemini はなんと 76% という不正解率を記録し、ChatGPT も 32% を記録しました。再チェックが要求されたとき、Gemini のエラー率は 12% に低下しましたが、ChatGPT のエラー率は 24% と高かったです。社会福祉士国家資格試験1級の合格には、全問題中60%の正答率があり、各時間帯の正答率が40%以上であることが必要です。これに基づいて、両方の AI が合格資格を達成できます。しかし、多くの受験生が資格学習をAIに依存する傾向にある中で、この結果はショボい成績表と言える。…

社労士試験を受けたAI「法律知識は難しい」

私たちの実験の結果、Gemini と ChatGPT はそれぞれ 13.5% と 10% という不正解率を記録し、「ひどい成績表」でした。

▲17日、第24回社会福祉士1級国家資格試験が行われたソウル市内の試験場で試験を終えて帰国する受験者たち。 (イ・ジュノ記者)

近年、介護を中心とした社会福祉分野においてもAIやロボットの導入が盛んに行われています。介護人材不足の代替策として、社会資源の無駄を最小限に抑えるために最先端のテクノロジーが導入されているからだ。もし人工知能(AI)が社会福祉士試験を受けたら、どんな結果が出るでしょうか?

韓国人材開発院が実施する第24回社会福祉士1級国家資格試験が17日、ソウル市内の各試験場で行われた。この日受験した試験問題を入手し、ChatGPT 5.2とGemini Proの各有料版で、3期にわたって提供された計200問を解いてもらった。

この試みは一種の簡易テストであり、その過程で入力されたコマンド(プロンプト)やメソッドに対する学術的なレビューは行われていないため、資格試験の問題の誤りや試験の信頼性を示唆するものではありません。実際、特定のテストにおける AI の「低いスコア」、つまり精度が期待を下回っていることは、すでに何度か証明されています。

このことは、昨年11月13日に実施された2026年度大学修学能力試験でも確認された。延世大学人工知能コンバージェンス学部先端コンバージェンス工学科のキム・シホ教授の研究チームは試験直後、ChatGPT(GPT-5)やGemini(2.5Flash)などのAIモデルの無料版を使って学生に2026年CSATの韓国語、英語、数学のセクションを解かせた。研究チームの実験では、ジェミニは韓国語共通領域で76点中42点、チャットGPTで37点を獲得し、数学共通領域では74点中62点、次いで70点を獲得した。英語は100点中63点と86点でした。専門家らは、このレベルではソウルの4年制大学に合格するのは難しいと評価した。

Naver CloudとKAISTが発表した論文「韓国教育基準を用いたマルチモーダル生成AIの評価」では、AIモデルはCSATの問題に困難を抱えていることが判明した。論文によると、GPT-4o、Gemini 1.5 Pro、Hyperclova

社会福祉士1級国家資格試験の試験の結果、全200問中、ジェミニは不正解が27件で誤答率13.5%、ChatGPTは不正解が20件で10%でした。そこで、誤答を再度チェックしてもらって修正しようとしたところ、Geminiは誤答7件で誤答率3.5%、ChatGPTは誤答10件で誤答率5%でした。興味深いのは、両AIが不正解を主張する問題は少なく、異なる不正解を主張するケースが多かった点だ。 2 つの AI に共通する誤答率は、問題全体のわずか 2% でした。

また、3時間目に行われた試験の「社会福祉政策と制度(社会福祉立法論)」では、両AIとも苦戦していることが目立った。最初のテストでは、25 問中、Gemini はなんと 76% という不正解率を記録し、ChatGPT も 32% を記録しました。再チェックが要求されたとき、Gemini のエラー率は 12% に低下しましたが、ChatGPT のエラー率は 24% と高かったです。

社会福祉士国家資格試験1級の合格には、全問題中60%の正答率があり、各時間帯の正答率が40%以上であることが必要です。これに基づいて、両方の AI が合格資格を達成できます。しかし、多くの受験生が資格学習をAIに依存する傾向にある中で、この結果はショボい成績表と言える。

#社労士試験を受けたAI法律知識は難しい

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。