Tokenización: BPE, SentencePieza y por qué es importante
Un LLM no lee letras ni palabras, lee tokens. Antes de que cualquier texto llegue al modelo, un tokenizador lo divide en una secuencia de números enteros de un vocabulario fijo. Este paso invisible da forma a todo: qué tan bien el modelo maneja la aritmética, qué tan caro es un mensaje que no esté en inglés, por qué GPT-4 no puede contar de manera confiable las letras de una palabra.