Haoze Wu
WaitHZ
AI & ML interests
RL, LLM, Agent
Recent Activity
updated a dataset about 6 hours ago
WaitHZ/SSPO-data authored a paper 26 days ago
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents