Токенизация: BPE, SentencePiece и почему это важно
LLM не читает буквы или слова — он читает токены. Прежде чем какой-либо текст достигнет модели, токенизатор разбивает его на последовательность целых чисел из фиксированного словаря. Этот невидимый шаг определяет все: насколько хорошо модель справляется с арифметикой, насколько дорогая неанглоязычная подсказка, почему GPT-4 не может надежно считать буквы в слове.