Generation evaluation metrics
6 methods in the atlas attack this one problem. They are rivals: each wins something the others do not.
Phrasings that mean this problem
Translation evaluationSummarization evaluationModel output evaluation
llm-training-alignment
- LLM-as-judgePairwise preference scoringstandardllm-training-alignment
- Perplexity evaluationHeld-out token likelihoodstandardllm-training-alignment
- Pass-at-k estimationUnbiased sampling estimatorspecialistllm-training-alignment
nlp-tasks
- BLEU scoringN-gram precisionstandardnlp-tasks
- ROUGE scoringN-gram recallstandardnlp-tasks
- BERTScoreContextual-embedding matchingspecialistnlp-tasks