arxiv:2606.19236
haipengluo
haipeng1
AI & ML interests
None yet
Recent Activity
upvoted a paper about 1 month ago
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training commentedon a paper about 2 months ago
STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability commentedon a paper about 2 months ago
STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability