DeepSeek-V4-Flash-Vision-Exp 在 SGLang v0.5.16 + 4×A800(SM80) 上的补丁部署交付 含视觉能力回移植、SM80 MXFP4/INT8 优化、DSPARK 工具调用 grammar 支持;提供一键构建镜像、一键部署及冒烟/压测脚本。可与上游 sglang 及官方 DeepSeek 模型仓库区分。
DeepSeek-V4.1-Flash · 8×A800 部署套件:在 8×A800-80GB 上开箱即用地跑起 1M 上下文的 DeepSeek-V4.1-Flash 推理服务。
LvLLM-DS4 部署工程 —— 基于开源引擎 LvLLM(vLLM 的 MoE GPU+NUMA 双并行扩展),在单机 8× A800 80GB 上部署与运维DeepSeek-V4-Flash-0731 的完整工程实践。本仓库定位为工程实践仓库,强调一手实操与可复用性。
在 SM80(Ampere,无原生 FP8 Tensor Core)的 8×A800 80GB 机器上, 基于 vllm/vllm-openai:glm53-flash 镜像部署原生 FP8 权重的 zai-org/GLM-5.3-Flash(320B-total / 18B-active 多模态 MoE,KDA 混合线性注意力。
Qwen3.8-27B 在 2× A800 80GB 上基于标准 vLLM 的自包含部署工程: 一键部署脚本、 修复版对话模板 (社区 Qwen-Fixed-Chat-Templates v22.4)、102 用例部署门禁测试与 基准数据。
在 4× NVIDIA A800 80GB PCIe(sm_80 / Ampere) 上部署 Qwen/Qwen3.8-Flash-Next-FP8的完整方案:TEP4 + CUDA graph + 多模态 + MTP3 投机解码 + 51B N-gram 表卸载。
MiniMax-M3-MXFP8(427B MoE,26B 活跃参数,MXFP8,原生多模态 VLM)在 8× NVIDIA A800 80GB 上的 vLLM 部署方案。
使用 Agent-Lightning + verl(GRPO)对小模型(Qwen3-1.7B)进行 Agentic 强化学习(RL),在 Spider 文本转 SQL 任务上显著提升 SQL 生成准确率。运行模块基于 LangGraph 构建的多轮 SQL-Agent(write → execute → check → rewrite)。
在 8×NVIDIA A800(sm80,Ampere)上部署 GLM-5.2-NVFP4 的完整方案。核心思路:vLLM v0.26.0 原生的稀疏 MLA 后端不支持 sm80,需应用社区补丁 PR #47629 新增纯 Triton 的 TRITON_MLA_SPARSE 后端,并修复 3 处 v0.26.0 API 漂移 + 1 个关键启动参数。
TrainerForge-3D 在 Linux 上为 Wine/Proton 游戏提供一键启动风灵月影(FLiNG)修改器与 UU3D 3D 模式自动部署注入。右键托盘图标,选择游戏,即刻到位。
TrainerForge 让你在 Linux 上为 Wine/Proton 游戏一键启动风灵月影(FLiNG)等 Windows 修改器。右键托盘图标,选择游戏,完成。