3 篇文章

  • DiT Generate Model in SGLang

    DiT Generate Model in SGLang 常见 DiT Generate 模型 Stable Diffusion 3(Image Generate) NOTE 文本(Text)和图像(Image)是两种本质不同的模态,因此应该使用两套独立的权重来分别处理它们,但在注意力机制(Attention)阶段允许两者进行交互。 双流架构:文本流 c 与图像流 x 各自用独立权重处理,仅在注意力处交互,以更好保留各自模态特征。 全局调制:由时间步 t 与汇聚文本向量构成的 y 经 SiLU+Linear,为两流各自产生 6 组调制参数(\alpha,\beta,\gamma,\delta,...

  • Masked Diffusion Large Language Model

    Masked Diffusion Large Language Model 📚 这里以 Ant Group 的 LLaDA 论文为例,介绍 Masked Diffusion LLM 的基本原理和实现方法;后面结合 SGLang 对该模型的推理实现进行说明。 Traing Details 基于掩码的扩散模型(Masked Diffusion Model) LLaDA 通过定义前向过程(Forward Process)和反向过程(Reverse Process)来建立模型分布 p_\theta(x_0)。 前向过程(破坏数据):LLaDA 不像传统扩散模型那样添加高斯噪声,而是通过掩码(Mask...

  • MultiModel Generate in SGLang

    MultiModel Generate in SGLang Overview SGLang Diffusion 采用了 Client-Server 架构,结合 多进程 (Multi-Process) 和 模块化流水线 (Modular Pipeline) 设计。 Client (DiffGenerator): 用户接口,负责发送请求和接收结果。 Server (Scheduler & Workers): 后端推理服务,由多个 GPU Worker 进程组成。 Rank 0 (Scheduler): 主节点,负责接收 Client 请求,并通过分布式广播将任务分发给所有 Worker。 ...