GigaToken: tokenizácia LLM modelov 500–1000× rýchlejšia ako Hugging Face a tiktoken
Čo sa stalo
Marcel Roed 22. júla 2026 zverejnil na GitHub GigaToken — open-source implementáciu tokenizéra pre jazykové modely s extrémnym výkonom, dosiahnutým optimalizáciami SIMD, minimalizáciou vetvenia a cachovaním premapovania.
Kontext a dopad
Tokenizácia je základným krokom pri tréningu a inferencii LLM. GigaToken je kompatibilný s Hugging Face Tokenizers a tiktoken API, takže sa dá adoptovať bez zmeny existujúcej pipeline. Pre firmy trénujúce na veľkých korpusoch môže predstavovať výraznú úsporu computingových zdrojov.
Detaily
- Výkon: 500-1000× rýchlejší ako Hugging Face Tokenizers
- Výkon: ~100× rýchlejší ako OpenAI tiktoken
- Benchmark: 5 564 Mtok/s na AMD EPYC 9565 72-Core
- Celý Common Crawl (130 bil. tokenov): hotový za ~6,5 hodiny
- Kompatibilita: Hugging Face Tokenizers API a tiktoken API
- Licencia: MIT, dostupný na GitHub
- HN score: 330 bodov
Otvoriť pôvodný zdroj
GitHub