1754649413
2025-08-08 10:27:00
Googleが紹介しました langextract、an オープンソースPythonライブラリ 開発者が、次のような大規模な言語モデルを使用して、構造化されたテキストから構造化された情報を抽出できるように設計されています ジェミニモデル。ライブラリは、臨床ノート、法的テキスト、顧客フィードバックなどのドキュメントを含む自由形式のテキストを構造化データに変換するプロセスを簡素化します。開発者は、自然言語の指示と例データを介して抽出タスクを定義し、さまざまなタイプの非構造化コンテンツから情報を簡単に処理および整理することができます。
Langextractの傑出した機能の1つは、その使用です 制御された生成技術。これにより、抽出された情報が一貫してフォーマットされ、テキスト内の元のソースに正確にリンクされることが保証されます。ライブラリは、関連するテキストのスパンを強調し、トレーサビリティを提供して、抽出された各エンティティが元のドキュメントの正確な場所にリンクされているようにします。この機能により、情報を抽出するときに透明性と信頼性が向上します。
長く複雑なドキュメントを処理するために、Langextractには次のような高度な戦略が組み込まれています テキストチャンキング、 並列処理、 そして 複数の抽出パス。これらの手法は、リコールと正確性を改善し、ライブラリが高品質の結果を維持しながら、テキストの大きな本体から情報を効果的に抽出できるようにするのに役立ちます。これにより、Langextractは、ヘルスケアから法的文書まで、さまざまなドメインのアプリケーションに適しており、基礎となるモデルの広範な微調整を必要としません。
langextractは、さまざまなLLMと統合できます。 ジェミニ およびなどのプラットフォームを介したローカルモデル オラマ。この柔軟性により、さまざまなモデルで作業する開発者にとって汎用性の高いツールになります。これにより、ユーザーは機械学習の深い専門知識を必要とせずに、幅広いアプリケーションの抽出タスクを定義できます。
Langextractのリリースは、開発者コミュニティ内で熱狂的な反応を引き起こしました。 Akshay Goel、主要な貢献者であり、プロジェクトの背後にある共同精神を反映して、ユーザーからの革新的なアプリケーションを見たいというリリースと熱意についての興奮を表明しました。
今日のチームと一緒にLangextractをリリースすることに興奮し、開発者コミュニティがそれを構築するものを見るのを楽しみにしています!
開発者 カイル・ブラウン それをAIの透明性における大きな前進として説明し、構造化された理解可能なデータに非構造化されたテキストを変換しました。勢いに加えて、Langextractのタイプスクリプトポートを追加し、OpenaiモデルとGoogleのGeminiの両方をサポートするための互換性を拡大し、コミュニティの積極的な関与を示しています。
興味のある人のために、私はこれをタイプスクリプトに移植し、ジェミニだけでなくOpenaiを使用する機能を追加しました。
ライブラリはApache 2.0ライセンスの下で利用でき、PIPで簡単にインストールできます。情報抽出機能をアプリケーションに追加しようとする開発者にアクセスしやすく強力なツールを提供します。
#Googleは構造化されていないテキストから構造化されたデータ抽出のためのPythonライブラリであるLangextractを発売しました