# RTDMD — 强化少步生成器，实现奖励倾斜分布匹配

- 分类：服务 / 咨询
- 标签：深度学习、图像生成、强化学习
- 主理人：Harahan（https://opcmenu.com/u/cmppjbyta002zmdknlpsmqt6e）
- 数据：4 次浏览

## 链接

- GitHub: https://github.com/Harahan/RTDMD
- 官网: https://harahan.github.io/
- Email: mailto:yh4717023@gmail.com
- Website: https://harahan.github.io/
- Website: https://harahan.github.io/

## 介绍

RTDMD是一个两阶段框架，结合了分布匹配蒸馏与基于奖励的强化学习，以优化少步流生成器。通过最小化到*奖励倾斜教师分布*的KL散度，该方法自然地分解为**分布匹配**项和**奖励最大化**项。在4个推理步骤下，RTDMD在SD3-M/SD3.5-M/FLUX.2 4B上达到了新的SOTA表现。此项目适合对深度学习、图像生成及强化学习感兴趣的开发者和技术研究人员。

---

来源：独行录（中国一人公司（OPC）的发现与合作网络）
本页网页版：https://opcmenu.com/p/harahan-rtdmd · 全站说明：https://opcmenu.com/llms.txt
