1751298937
2025-06-30 12:33:00
Openaiの高速でドロップインの実装 テックケン、大規模なテキスト処理用に設計されています。コードサンプルトークン化では2倍のスループットと4倍高速。
で実行されます AMD EPYC 4584PX - 16c/32t - 4.2 GHz。
- 速い正規表現解析:効率的なトークンパターンマッチングのための最適化されたPCRE2 REGEXエンジン
- ドロップイン交換:OpenaiのTiktokenトークネイザーとの完全な互換性
- 簡略化されたBPE:大規模な特別なトークン語彙のパフォーマンスへの影響を減らすための単純なアルゴリズム。
make clean && make
pip3 install tiktoken
python3 tests/test_tokendagger_vs_tiktoken.py --tokenizer llama
python3 tests/test_tokendagger_vs_tiktoken.py --tokenizer mistral
python3 tests/performance_benchmark.py --tokenizer llama
python3 tests/performance_benchmark.py --tokenizer mistral
python3 tests/code_performance_benchmark.py --tokenizer llama
================================================================================
🎉 CONCLUSION: TokenDagger is 4.02x faster on code tokenization!
================================================================================
git clone [email protected]:M4THYOU/TokenDagger.git
sudo apt install libpcre2-dev
git submodule update --init --recursive
sudo apt update && sudo apt install -y python3-dev
そして、オプションでテストを実行するために:
- PCRE2:Perl互換性のある正規表現 – ギルブ
#m4thyoutokendaggerOpenaiのTiktokenの高性能実装