arxiv:2606.14885
Tom Lu
eigentom
AI & ML interests
MLLM, Reinforcement Learning, Agentic RL
Recent Activity
upvoted a paper about 3 hours ago
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation published a dataset 5 days ago
eigentom/qwen35-4b-dci-rl-rewardv2-step10-bcp100-eval updated a dataset 5 days ago
eigentom/qwen35-4b-dci-rl-rewardv2-step10-bcp100-eval