view article Article Decoding LLM Alignment: A Concise Guide for GRPO and its variants Sneha7 • 3 days ago • 5
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Paper • 2609.13141 • Published 26 days ago • 69
view article Article LFM2.5 Q4\_0 Checkpoints from Quantization-Aware Distillation LiquidAI • Aug 19 • 37
view article Article Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps +1 iamleonie, burtenshaw, sergiopaniego • Sep 3 • 147
Agora: Git as Shared Memory for Collective AutoResearch Paper • 2609.18094 • Published 21 days ago • 58
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning Paper • 2609.20784 • Published 20 days ago • 57