Conozca Gigatoken: un tokenizador Rust BPE que codifica texto a 24,53 GB/s, hasta 989 veces más rápido que los tokenizadores HuggingFace

La tokenización es la única parte del conjunto de modelos de lenguaje que casi nadie perfila. Gigatoken, publicado por Marcel Rød (un estudiante de doctorado de Stanford) bajo una licencia del MIT, sostiene que esto fue un error. La biblioteca codifica texto a gigabytes por segundo en una sola máquina, frente a líneas de base que ya son multiproceso de Rust.

La evaluación comparativa del tokenizador GPT-2 arroja resultados notables: evaluado en el corpus owt_train.txt de 11,9 GB utilizando una configuración de doble socket AMD EPYC 9565 de 144 núcleos, Gigatoken procesa datos a una asombrosa velocidad de 24,53 GB/s. En comparación, el tiktoken de OpenAI alcanza 36,0 MB/s, mientras que los tokenizadores HuggingFace registran 24,8 MB/s en la misma configuración de hardware. Estas marcas demuestran ventajas de rendimiento de 681x y 989x, respectivamente.

En un Apple M4 Max con 16 núcleos, la misma carga de trabajo GPT-2 se ejecuta a 8,79 GB/s, o tokenizadores HuggingFace 1268x y tiktoken 140x. En un AMD Ryzen 7 9800X3D de consumo, funciona a 6,27 GB/s, o 106x y 68x. La aceleración no es un artefacto de una CPU o un vocabulario.

¿Qué es GigaToken?

Gigatoken es un tokenizador de codificación de pares de bytes (BPE) escrito en Rust con enlaces de Python. Se envía en PyPI como gigatoken (versión 0.9.0, lanzada el 21 de julio de 2026) y se instala con pip install gigatoken. El repositorio es 66,2% Rust y 33,3% Python. Admite 23 familias de tokenizadores distintas en los puntos de referencia publicados, que cubren GPT-2, GPT-OSS, Llama 3 a 4, Qwen 2 a 3.6, DeepSeek V3/R1/V4, GLM 4 y 5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma y Mistral.

Hay dos formas de utilizarlo. El modo de compatibilidad envuelve un tokenizador HuggingFace o tiktoken existente y preserva la paridad de salida exacta, con un costo real de rendimiento. El autor (Marcel) afirma en Hacker News que el modo de compatibilidad ofrece aproximadamente 200 a 300 veces según el uso, porque todavía paga los gastos generales de Python por la creación de listas y la conversión de cadenas a bytes. La API nativa de Gigatoken permite a Rust leer archivos directamente y es de donde provienen los números publicados.

El explorador de referencia interactivo

Cada número a continuación se extrae de la sección de puntos de referencia del repositorio y del registro de optimización del pretokenizer. Cambie de CPU, recorra el historial de optimización o calcule cuánto tiempo tardaría su propio corpus.