ICML 2026 | 我們讓蒸餾模型當(dāng)了采樣器,Diffusion RL采樣成本降低一個(gè)數(shù)量級(jí) 即時(shí)看
擴(kuò)散模型已經(jīng)成為圖像和視頻生成的重要底座,但當(dāng)研究者希望用在線強(qiáng)化學(xué)習(xí)進(jìn)一步優(yōu)化審美質(zhì)量、文本一致性和視頻綜合表現(xiàn)時(shí),訓(xùn)練成本很快成為瓶頸:每次 policy rollout 往往要完成大量去噪步驟,在線采樣占據(jù)了大量訓(xùn)練時(shí)間。
過去的 Diffusion RL 多聚焦于獎(jiǎng)勵(lì)設(shè)計(jì)與優(yōu)化算法,訓(xùn)練時(shí)的采樣成本被忽視。DMSampler 指出:在在線 RL 中,限制規(guī)模化的不只是獎(jiǎng)勵(lì)信號(hào)或優(yōu)化器,很多時(shí)候是 rollout 本身太貴。
最直接的想法是減少采樣步數(shù),例如從 50 步降至 10 步,但這會(huì)導(dǎo)致樣本質(zhì)量下降。一旦獎(jiǎng)勵(lì)模型基于劣化樣本進(jìn)行評(píng)估,策略更新便可能偏離高質(zhì)量分布。
【資料圖】
圖 1:傳統(tǒng) Diffusion RL 框架(左)與 DMSampler(右)的概念對(duì)比。傳統(tǒng)方法每次 RL 更新依賴約 50 步采樣;DMSampler 引入共同演化的少步蒸餾采樣器,圖中給出了 VBench 訓(xùn)練耗時(shí)從 900 小時(shí)降至 288 小時(shí)的對(duì)比。
讓蒸餾模型跟著 policy 一起進(jìn)化
DMSampler 的核心判斷是:蒸餾模型不應(yīng)僅是訓(xùn)練結(jié)束后的推理加速工具,更可作為低成本采樣器,深度參與 Diffusion RL 的每一輪策略更新。
- 論文標(biāo)題:Distillation Models are Good Samplers for Diffusion Reinforcement Learning
- 論文地址:https://openreview.net/pdf?id=VkMWujvv2c
- 項(xiàng)目地址:https://github.com/HiDream-ai/DMSampler
具體來說,該框架維護(hù)一個(gè)與 policy model 共同演化的 few-step distilled sampler。此采樣器僅需 4 至 8 步(圖像任務(wù) 7 步,視頻任務(wù) 16 步),并通過周期性重蒸餾來追隨更新后的策略。
圖 2:DMSampler 整體框架
整個(gè)框架由兩個(gè)階段交替組成。
RL 階段:蒸餾采樣器參數(shù)凍結(jié),用混合蒸餾采樣快速生成樣本;樣本經(jīng) reward model 打分后,用于更新 policy model。實(shí)驗(yàn)以 DiffusionNFT 為底層優(yōu)化器,但 DMSampler 的改動(dòng)在采樣環(huán)節(jié)。
蒸餾階段:更新后的 policy model 充當(dāng) teacher,對(duì) distilled sampler 進(jìn)行重蒸餾,使其重新貼近當(dāng)前 policy 分布。其中,軌跡分布匹配(TDM)保證基礎(chǔ)對(duì)齊,而獎(jiǎng)勵(lì)感知蒸餾則確保高獎(jiǎng)勵(lì)軌跡的能力得以保留。
兩階段循環(huán)推進(jìn)后,policy 通過 RL 獲得更好的生成能力,sampler 通過蒸餾同步追上新的 policy 分布,下一輪 RL 又能以更低的采樣成本繼續(xù)訓(xùn)練。
蒸餾:從后處理變?yōu)?RL 訓(xùn)練的一環(huán)
傳統(tǒng)流程中,蒸餾往往發(fā)生在訓(xùn)練之后。DMSampler 改變了這個(gè)順序,讓蒸餾從「后處理」變成訓(xùn)練閉環(huán)的一部分。
在此框架中,RL 階段借助蒸餾模型降低 rollout 成本,蒸餾階段又利用 RL 優(yōu)化后的 policy 提升蒸餾模型本身。兩者不再是先后關(guān)系,而是共同演化關(guān)系。
混合采樣:保住結(jié)構(gòu),提速后半程
在采樣策略上,DMSampler 并未把整個(gè)去噪鏈路都交給蒸餾模型。擴(kuò)散采樣的前半程更決定結(jié)構(gòu)、語義布局和主體內(nèi)容,后半程更多影響紋理與細(xì)節(jié)。因此,讓 policy model 先完成早期去噪,再由蒸餾模型接手后期步驟,可以在保持分布對(duì)齊的同時(shí)減少計(jì)算。
圖 3:四種采樣策略對(duì)比
論文比較了四種策略:S1 使用原 policy model 完成完整采樣并啟用 CFG,質(zhì)量強(qiáng)但成本高;S2 全程使用少步蒸餾模型,速度最快但分布漂移明顯;S3 先由 policy model 完成早期去噪,再切換到蒸餾模型處理后期步驟,是最終采用的方案;S4 則反過來先用蒸餾模型,早期偏差會(huì)影響后續(xù)結(jié)構(gòu),policy model 難以完全修正。
結(jié)果顯示,S3 在圖像任務(wù)中將步數(shù)從 40 步減至 7 步,視頻任務(wù)從 50 步減至 16 步,同時(shí)保持了較高的 OCR 表現(xiàn)。
獎(jiǎng)勵(lì)感知蒸餾
只讓蒸餾模型追上 policy 的平均分布還不夠,Diffusion RL 真正要保留的是高 reward 樣本背后的能力。
DMSampler 在 RL 階段記錄生成樣本、初始噪聲和對(duì)應(yīng) reward;進(jìn)入蒸餾階段后,框架從中篩選高 reward 軌跡。若無樣本超過閾值,則至少保留 reward 最高的一條。隨后,reward-weighted trajectory loss 會(huì)讓蒸餾模型更重視這些軌跡,權(quán)重隨 reward 單調(diào)增加。
消融實(shí)驗(yàn)顯示,去掉獎(jiǎng)勵(lì)感知蒸餾后,圖像 OCR 從 0.97 降到 0.96,視頻 OCR 從 0.50 降到 0.48。提升幅度有限,但說明高 reward 軌跡有助于穩(wěn)定迭代。
少步采樣帶來加速,性能基本不掉
在文本渲染任務(wù)上,DMSampler 將圖像采樣從 40 步降到 7 步、視頻采樣從 50 步降到 16 步,性能基本保持。與直接減少采樣步數(shù)(DRS)相比,優(yōu)勢(shì)顯著:DRS1 將步數(shù)減半并保留 CFG;DRS2 在此基礎(chǔ)上關(guān)閉 CFG;DRS3 進(jìn)一步降到 10 步。視頻任務(wù)對(duì)樣本質(zhì)量更敏感,DRS3 的視頻 OCR 回到基線水平,而 DMSampler 在 7 步圖像采樣和 16 步視頻采樣下仍保持接近完整采樣的表現(xiàn)。
表 1:DMSampler 與直接減步策略的對(duì)比。DMSampler? 為去掉 Reward-aware Distillation 的消融版本。
圖 4:不同加速策略生成的視頻效果對(duì)比。DRS 導(dǎo)致明顯質(zhì)量退化,DMSampler 保持高質(zhì)量。
GenEval 綜合評(píng)測(cè):從 0.63 提升到 0.96
在 GenEval 基準(zhǔn)測(cè)試上,DMSampler 取得 Overall 0.96,超過 FlowGRPO 和 DiffusionNFT 的 0.95;相比 Base(SD3.5-M)的 0.63,提升更為明顯。作為參照,GPT-4o 為 0.84,Qwen-Image 為 0.91。訓(xùn)練效率方面,論文報(bào)告 DMSampler 需要 360 GPU hours,低于 FlowGRPO 的 2000 GPU hours 和 DiffusionNFT 的 480 GPU hours。
表 2:GenEval 基準(zhǔn)測(cè)試結(jié)果。
1.3B 模型超過 14B,訓(xùn)練時(shí)間降至約三分之一
在 VBench 視頻評(píng)測(cè)上,DMSampler 將 Wan2.1-1.3B 的總分從 81.23 提升到 85.00,超過 Wan2.1-14B(83.69)及 CausVid(83.88)、HunyuanVideo(83.43)。相比 DiffusionNFT,DMSampler 將訓(xùn)練時(shí)間從約 900 小時(shí)降至約 288 小時(shí),總分從 84.74 提升至 85.00。
表 3:VBench 基準(zhǔn)測(cè)試結(jié)果(完整 16 個(gè)評(píng)測(cè)維度,分兩組展示)。
續(xù)表 3:其余 8 個(gè)評(píng)測(cè)維度
圖 5:VBench 生成視頻效果對(duì)比。
不綁定優(yōu)化器,可作為通用采樣模塊
DMSampler 不依賴某一個(gè) RL 優(yōu)化器。研究者將其分別接入 FlowGRPO 和 DGPO,并在 GenEval 上驗(yàn)證:FlowGRPO 的訓(xùn)練成本從超過 1000 GPU hours 降到 400 GPU hours,GenEval 分?jǐn)?shù)從 0.95 提升到 0.96;DGPO 的訓(xùn)練成本從 240 GPU hours 降到 192 GPU hours,GenEval 分?jǐn)?shù)保持 0.97。
表 4:DMSampler 接入不同 RL 優(yōu)化器的效果。
這表明,DMSampler 更像是一個(gè)面向在線 Diffusion RL 的采樣加速模塊。它不改變優(yōu)化器本身的目標(biāo)函數(shù),而是降低 rollout 成本,因此可以與不同 RL 方法組合使用。
副產(chǎn)品:蒸餾模型同步增強(qiáng)
DMSampler 的主要目標(biāo)是訓(xùn)練更強(qiáng)的 policy model,但共同演化的蒸餾采樣器本身也獲得了性能提升。在 VBench 上,該蒸餾模型取得 84.21 的總分和 85.60 的 Quality 分?jǐn)?shù),超過 CausVid(82.88)、Self Forcing(83.80)和 BLADE(83.38)等蒸餾方法。
表 5:DMSampler 蒸餾模型與其他蒸餾方法的對(duì)比。
傳統(tǒng)蒸餾側(cè)重推理加速,而 DMSampler 的蒸餾采樣器會(huì)在訓(xùn)練過程中不斷吸收 RL 優(yōu)化后的高 reward 能力。因此,它不僅是加速器,也成為經(jīng)過 reward 對(duì)齊的少步生成器。
圖 6:DMSampler 蒸餾模型的生成示例。
從訓(xùn)練加速到協(xié)同進(jìn)化
整體來看,DMSampler 首次將可訓(xùn)練、共同演化的蒸餾模型作為 Diffusion RL 的采樣引擎。通過雙階段交替訓(xùn)練、混合蒸餾采樣和獎(jiǎng)勵(lì)感知蒸餾,將 rollout 采樣成本降到更適合在線訓(xùn)練的范圍。
其意義不僅在于加速,更在于重新審視了采樣成本這一瓶頸,并將蒸餾從后處理前移,使之與 RL 后訓(xùn)練在同一閉環(huán)中相互增益。實(shí)驗(yàn)中,DMSampler 在 GenEval 上取得 0.96,在 VBench 上取得 85.00,均達(dá)到當(dāng)前最優(yōu)水平。訓(xùn)練效率上,GenEval 任務(wù)從 DiffusionNFT 的 480 GPU hours 降到 360 GPU hours,VBench 任務(wù)從約 900 小時(shí)降到約 288 小時(shí)。它不綁定特定 RL 優(yōu)化器,也可以與 FlowGRPO、DGPO 等方法組合使用。
對(duì)后續(xù)研究來說,DMSampler 的協(xié)同進(jìn)化思路可以遷移到其他需要大量 rollout 的生成模型 RL 場(chǎng)景,也為擴(kuò)散模型蒸餾與強(qiáng)化學(xué)習(xí)的結(jié)合提供了新的技術(shù)參考。
您可能也感興趣:
為您推薦
中國紅APP正式上線發(fā)布
第十二屆東亞地方政府會(huì)議將在山東臨沂召開 促進(jìn)東亞地區(qū)交流合作
排行
- 短期市場(chǎng)或仍將區(qū)間震蕩 關(guān)注價(jià)值股估值修復(fù)
- 郭樹清:三分之二以上的小微企業(yè)能拿到銀行貸款 深化金融改...
- 上半年我國銀行業(yè)凈利驟降近10% 怎么回事
- 融資環(huán)境逐步改善 金融活水澆灌個(gè)體工商戶
- 豬肉概念股盤中異動(dòng)拉升 大北農(nóng)漲逾6%多股跟漲
- 金融科技“加碼” 普惠金融是大型銀行轉(zhuǎn)型重要機(jī)遇
- 央行開展7000億元MLF操作 護(hù)航資金面平穩(wěn)運(yùn)行
- 中小銀行合并重組浪潮持續(xù) 農(nóng)村中小金融機(jī)構(gòu)改革或迎新突破
- 銀行互聯(lián)網(wǎng)貸款洗錢風(fēng)險(xiǎn)防范 有效反洗錢
- 監(jiān)管部門頻發(fā)聲 力促網(wǎng)貸風(fēng)險(xiǎn)出清
最近更新
- ICML 2026 | 我們讓蒸餾模型當(dāng)了采樣器,Diffusion RL采...
- 熱訊:德天空:哲科今天接受沙爾克體檢,隨后將簽下一份1年合同
- “發(fā)現(xiàn)好多大學(xué)生不懂郵件禮儀”上熱搜!網(wǎng)友:強(qiáng)烈建議納入...
- 生意社LLDPE8月2日均線下穿 均差為-33.83元/噸|焦點(diǎn)訊息
- 理想汽車(02015.HK)7月交付新車3.05萬輛 實(shí)時(shí)焦點(diǎn)
- 萊萬:美職聯(lián)對(duì)我而言是另一個(gè)世界,我的身體狀態(tài)會(huì)越來越好
- 大連北看臺(tái)發(fā)布預(yù)告:英博vs鐵人賽前會(huì)有全場(chǎng)拼圖TIFO 當(dāng)前熱議
- 比亞迪(002594):2026年7月產(chǎn)銷快報(bào)
- 老詹打完現(xiàn)有合同就能捧杯?麥迪一番表態(tài),撕裂湖人球迷兩大...
- 速訊:貸款“明白紙”,讓借款人不再“霧里看花”(政策解讀)
- 焦點(diǎn)簡訊:皇馬2-2佛羅倫薩,球隊(duì)展現(xiàn)“兩面性”,恩德里克破...
- 焦點(diǎn)要聞:“桂B(yǎng)A”北部賽區(qū)第五輪激戰(zhàn)來賓 梧州市隊(duì)客場(chǎng)取勝
- 圖片新聞|瑤歌繞山鄉(xiāng)!富川“桂鄉(xiāng)新風(fēng)·富川有約”賽歌會(huì)熱...
- 華海藥業(yè)(600521.SH):產(chǎn)品擬中選第十二批全國藥品集中采購
- 每日動(dòng)態(tài)!格靈深瞳(688207.SH):已累計(jì)回購1.17%公司股份
- 國城礦業(yè)(000688.SZ):首次回購115.1萬股公司股份
- 新動(dòng)態(tài):王仕鵬回應(yīng)將重返老東家宏遠(yuǎn),那句"我必須挺身而出"...
- 咋了!中山大學(xué)、廈門大學(xué)多輪征集志愿,無人填報(bào)
- 8月3日,中原科技學(xué)院2026年藝術(shù)高職(專科)批征集志愿開始...
- 成本哪些規(guī)則資產(chǎn)配置要關(guān)注?|百事通
- “固收+”7月遇損,121只“績優(yōu)生”僅剩零頭,困局要如何解?
- 第12批國家組織藥品集采開標(biāo) 覆蓋常用藥救命藥_信息
- 國產(chǎn)機(jī)器人有觸覺了,機(jī)器人的電子皮膚來了 焦點(diǎn)熱文
- 【獨(dú)家焦點(diǎn)】托管怎樣估算資產(chǎn)配置更關(guān)鍵?
- 成交價(jià)格怎樣影響投資回報(bào)更穩(wěn)妥?-當(dāng)前聚焦
- 今日熱搜:風(fēng)控紀(jì)律哪些細(xì)節(jié)交易決策需重視?
- 2026年暑期檔電影票房(含預(yù)售)已超71億元
- 焦點(diǎn)滾動(dòng):米體丨分析拉莫斯能否打破9號(hào)球衣魔咒
- 最新:時(shí)代變了,杜蘭特:當(dāng)年勇士3巨頭被罵不公平,現(xiàn)在76人...
- 深圳退休金大起底!月入5000元在鵬城竟只算“中等偏上”?_每...
今日要聞
- ICML 2026 | 我們讓蒸餾模型當(dāng)了采樣器,Diffusion RL采樣成本降低一個(gè)數(shù)量級(jí) 即時(shí)看
- 老詹打完現(xiàn)有合同就能捧杯?麥迪一番表態(tài),撕裂湖人球迷兩大陣營 熱資訊
- 咋了!中山大學(xué)、廈門大學(xué)多輪征集志愿,無人填報(bào)
- 成交價(jià)格怎樣影響投資回報(bào)更穩(wěn)妥?-當(dāng)前聚焦
- 每日熱議!拜仁公布韓國行大名單:迪亞斯在列,凱恩、奧利塞無緣
- 【高校歆球漫游】如何識(shí)別有前途的科技企業(yè),并把錢投給他們? AI識(shí)別已在路上 每日快播
- 華潤新能源上市后發(fā)展交流暨合作答謝會(huì)在港成功舉辦攜手中國政企合作基金開啟高質(zhì)量發(fā)展新篇章
- 近580股7月獲調(diào)研 電子、機(jī)械板塊高占比 這些權(quán)重股獲機(jī)構(gòu)關(guān)注_天天快報(bào)
- 每日速看!“ChinaCool”圈粉世界 海外游客解鎖避暑新方式
- 強(qiáng)悍泥人兒童障礙挑戰(zhàn)賽落地秦皇島北戴河新區(qū)


