Оценка заявок на получение LLM: метрики, LLM как судья и критерии
Когда вы отправляете заявку на получение LLM, откуда вы знаете, что она становится лучше, а не хуже? В отличие от классификатора, где точность говорит вам все, приложения LLM выдают открытые выходные данные, требующие многомерной оценки. В этом уроке рассматривается весь набор оценок: от автоматических показателей, которые вы можете использовать в CI, до LLM-as-judge, который масштабирует оценку на уровне человека, до общедоступных тестов, которые позволяют сравнивать вашу модель с полевыми.