色哟哟国产精品_亚洲视频视频在线_欧美顶级少妇做爰_亚洲欧美在线视频

首頁 資訊 > 金融 > 正文

ICML 2026 | 我們讓蒸餾模型當(dāng)了采樣器,Diffusion RL采樣成本降低一個(gè)數(shù)量級(jí) 即時(shí)看

擴(kuò)散模型已經(jīng)成為圖像和視頻生成的重要底座,但當(dāng)研究者希望用在線強(qiáng)化學(xué)習(xí)進(jìn)一步優(yōu)化審美質(zhì)量、文本一致性和視頻綜合表現(xiàn)時(shí),訓(xùn)練成本很快成為瓶頸:每次 policy rollout 往往要完成大量去噪步驟,在線采樣占據(jù)了大量訓(xùn)練時(shí)間。

過去的 Diffusion RL 多聚焦于獎(jiǎng)勵(lì)設(shè)計(jì)與優(yōu)化算法,訓(xùn)練時(shí)的采樣成本被忽視。DMSampler 指出:在在線 RL 中,限制規(guī)模化的不只是獎(jiǎng)勵(lì)信號(hào)或優(yōu)化器,很多時(shí)候是 rollout 本身太貴。

最直接的想法是減少采樣步數(shù),例如從 50 步降至 10 步,但這會(huì)導(dǎo)致樣本質(zhì)量下降。一旦獎(jiǎng)勵(lì)模型基于劣化樣本進(jìn)行評(píng)估,策略更新便可能偏離高質(zhì)量分布。


【資料圖】

圖 1:傳統(tǒng) Diffusion RL 框架(左)與 DMSampler(右)的概念對(duì)比。傳統(tǒng)方法每次 RL 更新依賴約 50 步采樣;DMSampler 引入共同演化的少步蒸餾采樣器,圖中給出了 VBench 訓(xùn)練耗時(shí)從 900 小時(shí)降至 288 小時(shí)的對(duì)比。

讓蒸餾模型跟著 policy 一起進(jìn)化

DMSampler 的核心判斷是:蒸餾模型不應(yīng)僅是訓(xùn)練結(jié)束后的推理加速工具,更可作為低成本采樣器,深度參與 Diffusion RL 的每一輪策略更新。

  • 論文標(biāo)題:Distillation Models are Good Samplers for Diffusion Reinforcement Learning
  • 論文地址:https://openreview.net/pdf?id=VkMWujvv2c
  • 項(xiàng)目地址:https://github.com/HiDream-ai/DMSampler

具體來說,該框架維護(hù)一個(gè)與 policy model 共同演化的 few-step distilled sampler。此采樣器僅需 4 至 8 步(圖像任務(wù) 7 步,視頻任務(wù) 16 步),并通過周期性重蒸餾來追隨更新后的策略。

圖 2:DMSampler 整體框架

整個(gè)框架由兩個(gè)階段交替組成。

RL 階段:蒸餾采樣器參數(shù)凍結(jié),用混合蒸餾采樣快速生成樣本;樣本經(jīng) reward model 打分后,用于更新 policy model。實(shí)驗(yàn)以 DiffusionNFT 為底層優(yōu)化器,但 DMSampler 的改動(dòng)在采樣環(huán)節(jié)。

蒸餾階段:更新后的 policy model 充當(dāng) teacher,對(duì) distilled sampler 進(jìn)行重蒸餾,使其重新貼近當(dāng)前 policy 分布。其中,軌跡分布匹配(TDM)保證基礎(chǔ)對(duì)齊,而獎(jiǎng)勵(lì)感知蒸餾則確保高獎(jiǎng)勵(lì)軌跡的能力得以保留。

兩階段循環(huán)推進(jìn)后,policy 通過 RL 獲得更好的生成能力,sampler 通過蒸餾同步追上新的 policy 分布,下一輪 RL 又能以更低的采樣成本繼續(xù)訓(xùn)練。

蒸餾:從后處理變?yōu)?RL 訓(xùn)練的一環(huán)

傳統(tǒng)流程中,蒸餾往往發(fā)生在訓(xùn)練之后。DMSampler 改變了這個(gè)順序,讓蒸餾從「后處理」變成訓(xùn)練閉環(huán)的一部分。

在此框架中,RL 階段借助蒸餾模型降低 rollout 成本,蒸餾階段又利用 RL 優(yōu)化后的 policy 提升蒸餾模型本身。兩者不再是先后關(guān)系,而是共同演化關(guān)系。

混合采樣:保住結(jié)構(gòu),提速后半程

在采樣策略上,DMSampler 并未把整個(gè)去噪鏈路都交給蒸餾模型。擴(kuò)散采樣的前半程更決定結(jié)構(gòu)、語義布局和主體內(nèi)容,后半程更多影響紋理與細(xì)節(jié)。因此,讓 policy model 先完成早期去噪,再由蒸餾模型接手后期步驟,可以在保持分布對(duì)齊的同時(shí)減少計(jì)算。

圖 3:四種采樣策略對(duì)比

論文比較了四種策略:S1 使用原 policy model 完成完整采樣并啟用 CFG,質(zhì)量強(qiáng)但成本高;S2 全程使用少步蒸餾模型,速度最快但分布漂移明顯;S3 先由 policy model 完成早期去噪,再切換到蒸餾模型處理后期步驟,是最終采用的方案;S4 則反過來先用蒸餾模型,早期偏差會(huì)影響后續(xù)結(jié)構(gòu),policy model 難以完全修正。

結(jié)果顯示,S3 在圖像任務(wù)中將步數(shù)從 40 步減至 7 步,視頻任務(wù)從 50 步減至 16 步,同時(shí)保持了較高的 OCR 表現(xiàn)。

獎(jiǎng)勵(lì)感知蒸餾

只讓蒸餾模型追上 policy 的平均分布還不夠,Diffusion RL 真正要保留的是高 reward 樣本背后的能力。

DMSampler 在 RL 階段記錄生成樣本、初始噪聲和對(duì)應(yīng) reward;進(jìn)入蒸餾階段后,框架從中篩選高 reward 軌跡。若無樣本超過閾值,則至少保留 reward 最高的一條。隨后,reward-weighted trajectory loss 會(huì)讓蒸餾模型更重視這些軌跡,權(quán)重隨 reward 單調(diào)增加。

消融實(shí)驗(yàn)顯示,去掉獎(jiǎng)勵(lì)感知蒸餾后,圖像 OCR 從 0.97 降到 0.96,視頻 OCR 從 0.50 降到 0.48。提升幅度有限,但說明高 reward 軌跡有助于穩(wěn)定迭代。

少步采樣帶來加速,性能基本不掉

在文本渲染任務(wù)上,DMSampler 將圖像采樣從 40 步降到 7 步、視頻采樣從 50 步降到 16 步,性能基本保持。與直接減少采樣步數(shù)(DRS)相比,優(yōu)勢(shì)顯著:DRS1 將步數(shù)減半并保留 CFG;DRS2 在此基礎(chǔ)上關(guān)閉 CFG;DRS3 進(jìn)一步降到 10 步。視頻任務(wù)對(duì)樣本質(zhì)量更敏感,DRS3 的視頻 OCR 回到基線水平,而 DMSampler 在 7 步圖像采樣和 16 步視頻采樣下仍保持接近完整采樣的表現(xiàn)。

表 1:DMSampler 與直接減步策略的對(duì)比。DMSampler? 為去掉 Reward-aware Distillation 的消融版本。

圖 4:不同加速策略生成的視頻效果對(duì)比。DRS 導(dǎo)致明顯質(zhì)量退化,DMSampler 保持高質(zhì)量。

GenEval 綜合評(píng)測(cè):從 0.63 提升到 0.96

在 GenEval 基準(zhǔn)測(cè)試上,DMSampler 取得 Overall 0.96,超過 FlowGRPO 和 DiffusionNFT 的 0.95;相比 Base(SD3.5-M)的 0.63,提升更為明顯。作為參照,GPT-4o 為 0.84,Qwen-Image 為 0.91。訓(xùn)練效率方面,論文報(bào)告 DMSampler 需要 360 GPU hours,低于 FlowGRPO 的 2000 GPU hours 和 DiffusionNFT 的 480 GPU hours。

表 2:GenEval 基準(zhǔn)測(cè)試結(jié)果。

1.3B 模型超過 14B,訓(xùn)練時(shí)間降至約三分之一

在 VBench 視頻評(píng)測(cè)上,DMSampler 將 Wan2.1-1.3B 的總分從 81.23 提升到 85.00,超過 Wan2.1-14B(83.69)及 CausVid(83.88)、HunyuanVideo(83.43)。相比 DiffusionNFT,DMSampler 將訓(xùn)練時(shí)間從約 900 小時(shí)降至約 288 小時(shí),總分從 84.74 提升至 85.00。

表 3:VBench 基準(zhǔn)測(cè)試結(jié)果(完整 16 個(gè)評(píng)測(cè)維度,分兩組展示)。

續(xù)表 3:其余 8 個(gè)評(píng)測(cè)維度

圖 5:VBench 生成視頻效果對(duì)比。

不綁定優(yōu)化器,可作為通用采樣模塊

DMSampler 不依賴某一個(gè) RL 優(yōu)化器。研究者將其分別接入 FlowGRPO 和 DGPO,并在 GenEval 上驗(yàn)證:FlowGRPO 的訓(xùn)練成本從超過 1000 GPU hours 降到 400 GPU hours,GenEval 分?jǐn)?shù)從 0.95 提升到 0.96;DGPO 的訓(xùn)練成本從 240 GPU hours 降到 192 GPU hours,GenEval 分?jǐn)?shù)保持 0.97。

表 4:DMSampler 接入不同 RL 優(yōu)化器的效果。

這表明,DMSampler 更像是一個(gè)面向在線 Diffusion RL 的采樣加速模塊。它不改變優(yōu)化器本身的目標(biāo)函數(shù),而是降低 rollout 成本,因此可以與不同 RL 方法組合使用。

副產(chǎn)品:蒸餾模型同步增強(qiáng)

DMSampler 的主要目標(biāo)是訓(xùn)練更強(qiáng)的 policy model,但共同演化的蒸餾采樣器本身也獲得了性能提升。在 VBench 上,該蒸餾模型取得 84.21 的總分和 85.60 的 Quality 分?jǐn)?shù),超過 CausVid(82.88)、Self Forcing(83.80)和 BLADE(83.38)等蒸餾方法。

表 5:DMSampler 蒸餾模型與其他蒸餾方法的對(duì)比。

傳統(tǒng)蒸餾側(cè)重推理加速,而 DMSampler 的蒸餾采樣器會(huì)在訓(xùn)練過程中不斷吸收 RL 優(yōu)化后的高 reward 能力。因此,它不僅是加速器,也成為經(jīng)過 reward 對(duì)齊的少步生成器。

圖 6:DMSampler 蒸餾模型的生成示例。

從訓(xùn)練加速到協(xié)同進(jìn)化

整體來看,DMSampler 首次將可訓(xùn)練、共同演化的蒸餾模型作為 Diffusion RL 的采樣引擎。通過雙階段交替訓(xùn)練、混合蒸餾采樣和獎(jiǎng)勵(lì)感知蒸餾,將 rollout 采樣成本降到更適合在線訓(xùn)練的范圍。

其意義不僅在于加速,更在于重新審視了采樣成本這一瓶頸,并將蒸餾從后處理前移,使之與 RL 后訓(xùn)練在同一閉環(huán)中相互增益。實(shí)驗(yàn)中,DMSampler 在 GenEval 上取得 0.96,在 VBench 上取得 85.00,均達(dá)到當(dāng)前最優(yōu)水平。訓(xùn)練效率上,GenEval 任務(wù)從 DiffusionNFT 的 480 GPU hours 降到 360 GPU hours,VBench 任務(wù)從約 900 小時(shí)降到約 288 小時(shí)。它不綁定特定 RL 優(yōu)化器,也可以與 FlowGRPO、DGPO 等方法組合使用。

對(duì)后續(xù)研究來說,DMSampler 的協(xié)同進(jìn)化思路可以遷移到其他需要大量 rollout 的生成模型 RL 場(chǎng)景,也為擴(kuò)散模型蒸餾與強(qiáng)化學(xué)習(xí)的結(jié)合提供了新的技術(shù)參考。

關(guān)鍵詞: rl 樣本 采樣器 蒸餾模型 diffusion

最近更新

關(guān)于本站 管理團(tuán)隊(duì) 版權(quán)申明 網(wǎng)站地圖 聯(lián)系合作 招聘信息

Copyright © 2005-2023 創(chuàng)投網(wǎng) - m.69066a.com All rights reserved
聯(lián)系我們:311 3831 582@qq.com
皖I(lǐng)CP備2022009963號(hào)-3

主站蜘蛛池模板: 国产专区欧美专区| 国产精品第一页在线| 日韩中文字幕视频在线| 日韩精品一区在线视频| 国产啪精品视频| 久久中文精品视频| 视频一区二区三区免费观看| 国产中文字幕免费观看| 久久久久久久香蕉| 免费av在线一区| 日本久久中文字幕| 日韩中文有码在线视频| 91九色国产ts另类人妖| 国产精品免费久久久久久| 日韩精品―中文字幕| 中文字幕日韩精品无码内射| 国产不卡精品视男人的天堂| 国产精品国产亚洲精品看不卡 | www..com日韩| 国产精品高潮在线| www.av中文字幕| 中文字幕99| 亚洲高清视频一区| 色婷婷成人综合| 日本在线播放一区| 日韩一区av在线| 欧美区高清在线| 日本亚洲欧洲精品| 欧美激情综合色综合啪啪五月| 久久亚洲精品网站| 激情视频综合网| 国产精品久久久久av免费| www.日韩系列| 日日夜夜精品网站| 欧美二区在线| 国产无套内射久久久国产| 国产精品吹潮在线观看| 亚洲综合中文字幕在线| 日产日韩在线亚洲欧美| 久久免费观看视频| 国产精品视频中文字幕91|