مدلهای انتشاری یاد گرفتهاند تصویر نویزی را «پاک» کنند. اگر از نویز خالص شروع کنند و هر قدم را با توصیف متنی هدایت کنند، تصویری تازه میسازند. Midjourney، Stable Diffusion و مولدهای ویدیو مثل Runway و Kling بر همین پایهاند.
کیفیت خروجی به مدل، تعداد قدمها و پرامپت بستگی دارد؛ پلنهای بالاتر معمولاً حالتهای سریع و کیفیت بالاتر را باز میکنند.