
文章核心總結(jié)與創(chuàng)新點(diǎn)主要內(nèi)容該研究聚焦思維感知型多模態(tài)生成的核心問題——現(xiàn)有序列自回歸模型因誤差傳播導(dǎo)致性能下降,提出ParaBench基準(zhǔn)用于評(píng)估文本-圖像對(duì)齊質(zhì)量,進(jìn)而設(shè)計(jì)MMaDA-Parallel并行多模態(tài)擴(kuò)散框架,通過雙向跨模態(tài)交互和軌跡級(jí)強(qiáng)化學(xué)習(xí)(ParaRL),解決推理與生成的對(duì)齊問題,在復(fù)雜圖像編輯和生成任務(wù)中實(shí)現(xiàn)性能提升。核心創(chuàng)新點(diǎn)ParaBench基準(zhǔn):首個(gè)同時(shí)評(píng)估文本推理質(zhì)量、圖像生成質(zhì)量及跨模態(tài)對(duì)齊的基準(zhǔn),含300個(gè)挑戰(zhàn)性提示(200個(gè)編輯任務(wù)、100個(gè)生成任務(wù)),覆蓋空間、時(shí)間、因果等多類推理場(chǎng)景。并行多模態(tài)擴(kuò)散框架:突破序列生成限制,文本與圖像在整個(gè)去噪過程中同步生成,通過雙向注意力實(shí)現(xiàn)實(shí)時(shí)交互,避免誤差累積。ParaRL強(qiáng)化學(xué)習(xí):軌跡級(jí)優(yōu)化策略,在去噪每一步施加語義獎(jiǎng)勵(lì),而非僅優(yōu)化最終輸出,強(qiáng)化跨模態(tài)一致性。數(shù)據(jù)構(gòu)建方案:通過VLM為圖像編輯/生成數(shù)據(jù)生成推理軌跡,構(gòu)建含15萬樣本的四元組訓(xùn)練集(輸入圖像、指令、推理軌跡、輸出圖像),支撐監(jiān)督微調(diào)。翻譯部分(Markdown格式)Abstract思維感知型生成旨在提升復(fù)雜任務(wù)性能,但我們發(fā)現(xiàn)現(xiàn)有序列自回歸方法存在一個(gè)關(guān)鍵失效模