llm-training-alignment
36 entries in Machine Learning & AI.
- Tensor parallelismRow-column weight shardingstandardllm-training-alignment
- Pipeline parallelismMicro-batch bubble reductionstandardllm-training-alignment
- Sequence parallelismActivation sharding along tokensspecialistllm-training-alignment
- Expert parallelismToken routing across devicesspecialistllm-training-alignment
- ZeROOptimizer-state shardingstandardllm-training-alignment
- Fully sharded data parallelShard-gather-reshard parametersstandardllm-training-alignment
- Gradient checkpointingRecompute activations on backwardstandardllm-training-alignment
- Gradient accumulationMicro-batch gradient summationstandardllm-training-alignment
- Mixed-precision trainingLoss scalingstandardllm-training-alignment
- FP8 trainingPer-tensor scaling factorsspecialistllm-training-alignment
- QLoRAFour-bit NormalFloat base weightsstandardllm-training-alignment
- Prefix tuningLearned prefix key-value vectorsspecialistllm-training-alignment
- RLHFProximal policy optimization on a reward modelcanonllm-training-alignment
- Direct preference optimizationImplicit reward reparameterizationcanonllm-training-alignment
- IPOIdentity preference objectivespecialistllm-training-alignment
- KTOProspect-theoretic utility lossspecialistllm-training-alignment
- ORPOOdds-ratio preference lossspecialistllm-training-alignment
- GRPOGroup-relative advantage baselinestandardllm-training-alignment
- Constitutional AISelf-critique and revisionstandardllm-training-alignment
- Rejection sampling fine-tuningBest-of-n distillationspecialistllm-training-alignment
- Reward model trainingBradley-Terry pairwise lossstandardllm-training-alignment
- Process reward modelingStep-level supervisionspecialistllm-training-alignment
- Chain-of-thought promptingStep-by-step elicitationcanonllm-training-alignment
- Self-consistencyMajority vote over sampled chainsstandardllm-training-alignment
- Tree of thoughtsDeliberate search over partial thoughtsstandardllm-training-alignment
- Least-to-most promptingSubproblem decompositionspecialistllm-training-alignment
- ReActInterleaved reasoning and actingcanonllm-training-alignment
- ToolformerSelf-supervised API call insertionspecialistllm-training-alignment
- ReflexionVerbal self-feedback memoryspecialistllm-training-alignment
- LLM-as-judgePairwise preference scoringstandardllm-training-alignment
- Perplexity evaluationHeld-out token likelihoodstandardllm-training-alignment
- Pass-at-k estimationUnbiased sampling estimatorspecialistllm-training-alignment
- Sequence-level distillationTeacher-generated targetsspecialistllm-training-alignment
- Curriculum data mixingPhase-scheduled corpus weightsspecialistllm-training-alignment
- Deduplication for pretrainingSuffix-array exact substring removalspecialistllm-training-alignment
- Data quality filteringClassifier-scored web textspecialistllm-training-alignment