Models from the paper "LaSeR: Reinforcement Learning with Last-Token Self-Rewarding"
Wenkai Yang
Keven16
AI & ML interests
None yet
Organizations
None yet
models 18
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step1200
4B • Updated • 99
Keven16/Qwen3-4B-Non-Thinking-RL-Code-Step300
4B • Updated • 103 • 1
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step1200
4B • Updated • 321
Keven16/Qwen3-4B-Non-Thinking-RL-Math-Step500
4B • Updated • 269 • 1
Keven16/Qwen2.5-7B-LaSeR
8B • Updated • 2
Keven16/OctoThinker-3B-Short-LaSeR
4B • Updated • 3
Keven16/ORZ-7B-LaSeR
8B • Updated • 4
Keven16/DeepCritic-7B-RL1.5-PRM800K
8B • Updated • 4
Keven16/DeepCritic-7B-RL1.5-Numina
8B • Updated • 4
Keven16/Qwen2.5-32B-TOPS-Iter-DPO-Preview
33B • Updated • 6
datasets 6
Keven16/OPSD-Example-Data
Viewer • Updated • 49.1k • 46
Keven16/G-OPD-Training-Data
Viewer • Updated • 134k • 621 • 3
Keven16/LaSeR_training_data
Viewer • Updated • 104k • 22 • 2
Keven16/TOPS-Data
Preview • Updated • 31
Keven16/DeepCritic-RL-Data
Viewer • Updated • 55k • 18
Keven16/DeepCritic-4.5K
Preview • Updated • 9