arxiv:2608.12764
Haoze Wu
WaitHZ
AI & ML interests
RL, LLM, Agent
Recent Activity
updated a dataset about 23 hours ago
WaitHZ/SSPO-data authored a paper 27 days ago
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents