ResearchHub Endowment
Earn daily Funding Credits to fund science
Paper
Paper
Search
Log in
Sign up
Sign up
Publish
Home
My Funding
Peer Review
Journal
Endowment
Help & resources
EMA Policy Gradient: Taming Reinforcement Learning for LL... | ResearchHub
ResearchHub Endowment
Earn daily Funding Credits to fund science
Paper
Paper
Search
Log in
Sign up
Sign up
Publish
Home
My Funding
Peer Review
Journal
Endowment
Help & resources
EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL
By
Lunjun Zhang
1 more
Lunjun Zhang
·
Jimmy Ba
February 4, 2026
36
Paper
Reviews
0
Conversation
0
Bounties
0
Loading PDF viewer…
Preprint Server
Topics
#computer-science
DOI
10.48550/arXiv.2602.04417
License
CC-BY
Other Formats
PDF