Оценка генеративных моделей: недоумение, BLEU и FID
Оценить генеративную модель гораздо сложнее, чем оценить классификатор. Для классификации имеется одна правильная метка; для генерации существует бесконечно много хороших результатов. «Солнце светит» и «Яркое солнце светит» являются прекрасными продолжениями одной и той же подсказки, но метрика, требующая точного совпадения строк, не сможет выполнить вторую.