1734630055
2024-12-19 17:40:00
チームは、GPT-4 (OpenAI)、Llama 3 (Meta)、Mixtral モデル (Mistral AI) を含む 10 の人気のある LLM をテストし、CT および MRI スキャンから得た 100 の偽の自由テキスト放射線医学レポートを 9 つのレポートに翻訳させました。ターゲット言語。報告書はこれまでに18人の放射線科医によって翻訳されていた。モデルの精度は、BiLingual Evaluation Understudy (BLEU) スコア、翻訳エラー率 (TER)、および CHaRacter レベルの F スコア (chrF++) メトリクスを使用して決定されました。
全体として、GPT-4 が最も優れた翻訳を実現しましたが、LLM は英語をドイツ語、ギリシャ語、タイ語、トルコ語に翻訳する場合に特にうまく機能しました。 GPT-4 の前身である GPT-3.5 は英語からフランス語への翻訳が最も正確でしたが、Qwen1.5 は英語から中国語への翻訳に最適で、Mixtral 8x22B はイタリア語から英語への翻訳に最適でした。
総合すると、大規模なLLMの結果は明確で読みやすく、元の報告書と一致しているとみなされたが、特定の医学用語にはいくつかの矛盾があり、患者に矛盾した情報を提供する危険性があると著者らは指摘している。
パフォーマンスは主にトレーニング データに依存していましたが、コンテキストの長さの制限や非効率なトークン化によってパフォーマンスが阻害されたものもあったとグループは付け加えています。
「大規模な言語モデルは医療レポートの翻訳に高い可能性を示しますが、万能のモデルはありません」と研究チームは書いており、分析は厳密に実験的であると付け加えています。「モデルの医療翻訳のパフォーマンスは、選択したモデルとターゲットに依存します」一般に、大きなモデルは小さなモデルよりも優れたパフォーマンスを発揮します。」
研究について詳しく知る ここ。
#大規模な言語モデルは放射線医学レポートにおける言語の壁を打ち破ることができるでしょうか