Preprint
Jul 2026
Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy
A 170M-parameter M2S model trained on about 262B OpenWebText token slots outperforms the evaluated pure-uniform SEDD, GIDD, and Neural CTMC checkpoints at every tested sampling budget, reaching generative PPL $143.3$ at 128 steps versus $183.6$ for the strongest pure-uniform baseline.
Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang et al.
· 1 citation