尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

SGLang Diffusion WebUI 使用指南:一条命令启动图像与视频生成界面

发布时间:2026/9/11 6:23:00

资讯中心
01
ARTICLE

SGLang Diffusion WebUI 使用指南:一条命令启动图像与视频生成界面

SGLang Diffusion WebUI 使用指南:一条命令启动图像与视频生成界面
SGLang Diffusion WebUI 使用指南一条命令启动图像与视频生成界面【免费下载链接】sglangSGLang is a high-performance serving framework for large language models and multimodal models.项目地址: https://gitcode.com/GitHub_Trending/sg/sglang导读SGLang Diffusion WebUI 是 SGLang 多模态生成框架内置的一套基于 Gradio 的图形化推理界面它让开发者无需编写任何客户端代码即可在浏览器中直接对文生图、文生视频、图生图、图生视频等 Diffusers 模型进行参数调优与实时预览。本文以 WebUI 官方说明 为主体结合仓库内 WebUI 前端实现、服务端启动链路与单元测试系统讲解 WebUI 的安装前置条件、五种典型启动命令含 MiniMax H3 多分区启动、SSH 端口转发访问方式以及界面中每个控件的含义与底层参数映射帮助读者快速在本地或远程服务器上搭建一套可交互的多模态生成工作台。前置条件安装 GradioWebUI 基于 Gradio 构建启动服务前需先安装与仓库版本匹配的 Gradiopip install gradio6.1.0从源码结构看webui/main.py 中import gradio as gr被刻意放在函数内部执行注释为 import gradio in function to avoid CI crash因此即使环境里没有 GradioSGLang 其余模块也能正常导入只有真正启动 WebUI 时才要求 Gradio 可用。启动 WebUI 服务一条命令完成SGLang Diffusion 已集成 WebUI无需单独部署前端服务只需在启动命令中追加--webui参数即可sglang serve --model-path MODEL_PATH_OR_ID [其他参数] --webui --webui-port 2333参数解析与默认值--webui与--webui-port两个参数定义在 server_args.py--webui布尔开关默认False含义为 Whether to use webui for better display--webui-portWebUI 监听端口默认值为12312见 server_args.py 中webui_port: int | None 12312。示例命令中统一使用2333读者可按需修改。启动链路服务端如何编排当传入--webui后启动流程在 serve.py 中分两步完成先调用dispatch_launch(server_args)拉起模型调度与推理进程再调用run_sgl_diffusion_webui(server_args)启动 Gradio 界面。在 launch_server.py 中可以看到启用 WebUI 时FastAPI 服务器会被放入一个独立的子进程进程名sglang-diffusion-webui运行从而避免 Gradio 与 FastAPI 在同一个进程内抢占事件循环WebUI 主线程则通过sync_scheduler_client与推理后端通信。这种推理后端 FastAPI 子进程 Gradio 界面的三层结构是理解整个服务拓扑的关键。场景一启动文生图服务Text-to-Imagesglang serve --model-path black-forest-labs/FLUX.1-dev --num-gpus 1 --webui --webui-port 2333--model-path black-forest-labs/FLUX.1-devFLUX.1-dev 文生图模型--num-gpus 1单卡即可运行。启动成功后浏览器访问http://localhost:2333即可输入 Prompt 生成图片并通过界面右侧的 Generated Image 区域实时预览结果。场景二启动文生视频服务Text-to-Videosglang serve --model-path Wan-AI/Wan2.2-T2V-A14B-Diffusers --num-gpus 1 --webui --webui-port 2333该命令加载 Wan2.2-T2V 文生视频 Diffusers 模型。启动后界面会自动切换为视频模式num_frames帧数与frames_per_second帧率两个滑块变为可见生成结果以视频文件形式在 Generated Video 区域播放。场景三启动图生图服务Image-to-Imagesglang serve --model-path Qwen/Qwen-Image-Edit-2511 --num-gpus 1 --webui --webui-port 2333图生图场景下需要在界面底部的 reference images 输入框中提供参考图路径见下文界面说明模型将基于参考图与 Prompt 生成编辑后的图像。场景四启动图生视频服务Image-to-Videosglang serve --model-path Wan-AI/Wan2.2-TI2V-5B-Diffusers --num-gpus 1 --webui --webui-port 2333Wan2.2-TI2VImage-to-Video模型以参考图为起点生成视频片段。与文生视频类似界面会显示帧数与帧率控制项。场景五启动 MiniMax H3原生音视频联合生成MiniMax H3 使用原生的视频 音频联合请求契约服务启动时必须通过--model-variant显式选择权重分区partition不同分区对外提供不同的任务组合# 服务 t2va文生视频音频与 fl2va首帧/末帧生视频音频 sglang serve --model-path MiniMaxAI/MiniMax-H3 --model-variant fl2va \ --num-gpus 4 --ulysses-degree 4 --webui --webui-port 2333 # 服务 ref2va参考媒体生视频音频 sglang serve --model-path MiniMaxAI/MiniMax-H3 --model-variant ref2va \ --num-gpus 4 --ulysses-degree 4 --webui --webui-port 2333注意MiniMax H3 体积较大示例中采用--num-gpus 4 --ulysses-degree 4的四卡配置请根据实际显存调整。H3 的界面能力与限制WebUI 针对 H3 暴露了task任务选择、条件媒体首帧/末帧/参考图/参考视频/参考音频、目标短边short edge/宽高比aspect ratio/时长duration、联合去噪步数、视频与音频的 flow shift、随机种子等控制项见 minimax_h3.py 的 Gradio 布局。同时必须理解 H3 的以下约束README 明确说明H3 是CFG-distilledCFG 蒸馏模型因此通用的负向提示词negative prompt、guidance scale、手动 FPS、帧数、宽高、TeaCache 等控制项不适用H3 输出固定为24 FPS其帧数与画布尺寸由目标时长与宽高比推导得出。这与仓库中 sampling_params.py 的fps: int 24默认值一致印证了 H3 固定帧率的设定。H3 请求校验逻辑从源码看minimax_h3.py 的build_minimax_h3_sampling_params_kwargs对三类任务做了严格的媒体校验t2va不接受任何条件媒体条件列表为空fl2va必须提供首帧和/或末帧且只接受 keyframe 类条件传入参考媒体会报错ref2va必须提供参考图、参考视频或参考音频中的至少一种。路径与 URL 统一通过_material_uri转换为file://或http(s)://URI 后再进入请求体。这些规则在 test_webui.py 中有对应的单元测试如test_h3_webui_rejects_invalid_task_media覆盖验证。端口转发远程安全访问WebUI 服务运行在远端服务器上时需要通过SSH 端口转发将远程端口安全地映射到本地ssh -L ${WEBUI_PORT}:localhost:${WEBUI_PORT} user_namemachine_name例如--webui-port 2333对应的转发命令为ssh -L 2333:localhost:2333 user_namemachine_name多数 IDEVS Code、Cursor 等的远程开发/端口转发功能可以自动完成这一过程若未自动转发再手动执行上述命令。界面说明控件与参数映射启动成功后在浏览器访问http://localhost:${WEBUI_PORT}。界面上方直接展示当前加载的模型路径Model与任务名Task name。任务名由 WebUI 在启动时自动识别优先查询 HuggingFace Hub 的pipeline_tag或 ModelScope 的任务标签Hub 查询失败时回退到本地 pipeline 自身的task_type识别为text-to-video、image-to-video、video-to-video时切换为视频模式否则为图像模式见 main.py。若使用 ModelScope 拉取模型可通过环境变量SGLANG_USE_MODELSCOPE开启对应查询路径。通用生成控件以下控件定义于 main.py其取值范围、默认值及与采样参数的对应关系如下控件类型范围 / 默认值对应采样参数Prompt文本框默认 A curious raccoonpromptNegative_prompt文本框内置一段较长的通用负向提示词negative_promptseed数字默认 1234seedwidth / height数字默认 720 × 480width/heightnum_inference_steps滑块0 ~ 50默认 20num_inference_stepsguidance_scale滑块0.0 ~ 10.0默认 5.0步长 0.01guidance_scalenum_frames滑块仅视频模式可见1 ~ 181默认 81num_framesframes_per_second滑块仅视频模式可见4 ~ 60默认 16fpsreference images文本框参考图路径或 URL多个用英文逗号分隔image_pathenable_teacache复选框默认关闭enable_teacache使用 reference images 时注意多个参考图之间必须使用英文逗号分隔代码会自动将中文全角逗号替换为英文逗号但会打印告警日志提示用户改用英文逗号支持本地路径如image1.png, image2.png与 URL如https://example.com/image1.png。所有控件点击Generate按钮后会组装成SamplingParams并交给sync_scheduler_client.forward()执行推理视频结果以文件路径形式返回播放图像结果以np.ndarray帧数据渲染见 main.py。此外sampling_params.py 中的align_num_frames_for_num_gpus会在多卡场景下自动把帧数对齐到 GPU 可整除的数值因此即使手动输入的num_frames与显卡数不整除后端也会自动规整无需用户担心。小结SGLang Diffusion WebUI 把模型加载、采样参数调优、结果预览整合进了一个 Gradio 页面对普通 Diffusers 模型一条sglang serve ... --webui命令即可获得完整的文生图/文生视频/图生图/图生视频交互界面对 MiniMax H3 这类原生音视频联合模型则通过--model-variant分区选择与专用 H3 控件提供定制化支持。结合 serve.py 的启动编排、launch_server.py 的进程拆分、minimax_h3.py 的请求校验以及 test_webui.py 的测试覆盖开发者既可以开箱即用地完成推理演示也可以以此为模板扩展新的多模态生成模型接入。【免费下载链接】sglangSGLang is a high-performance serving framework for large language models and multimodal models.项目地址: https://gitcode.com/GitHub_Trending/sg/sglang创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。