杀生

@kill-life

杀生 暂无简介

杀生的个人主页
/
关注的仓库(39)

    Watch 杀生 / dsv4-vision-exp-sglang-sm80

    DeepSeek-V4-Flash-Vision-Exp 在 SGLang v0.5.16 + 4×A800(SM80) 上的补丁部署交付 含视觉能力回移植、SM80 MXFP4/INT8 优化、DSPARK 工具调用 grammar 支持;提供一键构建镜像、一键部署及冒烟/压测脚本。可与上游 sglang 及官方 DeepSeek 模型仓库区分。

    最近更新: 11天前

    Watch 杀生 / dsv4.1-flash-vllm-sm80-deploy

    DeepSeek-V4.1-Flash · 8×A800 部署套件:在 8×A800-80GB 上开箱即用地跑起 1M 上下文的 DeepSeek-V4.1-Flash 推理服务。

    最近更新: 11天前

    Watch 杀生 / dsh-lan-access

    让 DeepSeek Harness dsh 的 Web UI 在本机局域网(私有网络)内供多台机器访问的完整排障与配置实践。

    最近更新: 25天前

    Watch 杀生 / DeeepseekV4Flash0731-LVLLM-A800-Deployment

    LvLLM-DS4 部署工程 —— 基于开源引擎 LvLLM(vLLM 的 MoE GPU+NUMA 双并行扩展),在单机 8× A800 80GB 上部署与运维DeepSeek-V4-Flash-0731 的完整工程实践。本仓库定位为工程实践仓库,强调一手实操与可复用性。

    最近更新: 29天前

    Watch 杀生 / Glm5.3FlashDeploymentA800

    在 SM80(Ampere,无原生 FP8 Tensor Core)的 8×A800 80GB 机器上, 基于 vllm/vllm-openai:glm53-flash 镜像部署原生 FP8 权重的 zai-org/GLM-5.3-Flash(320B-total / 18B-active 多模态 MoE,KDA 混合线性注意力。

    最近更新: 1个月前

    Watch 杀生 / qwen3.8-27b-deployment-a800

    Qwen3.8-27B 在 2× A800 80GB 上基于标准 vLLM 的自包含部署工程: 一键部署脚本、 修复版对话模板 (社区 Qwen-Fixed-Chat-Templates v22.4)、102 用例部署门禁测试与 基准数据。

    最近更新: 1个月前

    Watch 杀生 / Glm5.3DeploymentA800

    在 8×NVIDIA A800(sm80,Ampere)上使用vllm 0.28.0部署 GLM-5.3-NVFP4 的完整方案。

    最近更新: 1个月前

    Watch 杀生 / Qwen3.8FlashDeploymentA800

    在 4× NVIDIA A800 80GB PCIe(sm_80 / Ampere) 上部署 Qwen/Qwen3.8-Flash-Next-FP8的完整方案:TEP4 + CUDA graph + 多模态 + MTP3 投机解码 + 51B N-gram 表卸载。

    最近更新: 1个月前

    Watch 杀生 / MiniMax-M3-MXFP8-vLLM-A800-Deployment

    MiniMax-M3-MXFP8(427B MoE,26B 活跃参数,MXFP8,原生多模态 VLM)在 8× NVIDIA A800 80GB 上的 vLLM 部署方案。

    最近更新: 1个月前

    Watch 杀生 / sql-agent-rl

    使用 Agent-Lightning + verl(GRPO)对小模型(Qwen3-1.7B)进行 Agentic 强化学习(RL),在 Spider 文本转 SQL 任务上显著提升 SQL 生成准确率。运行模块基于 LangGraph 构建的多轮 SQL-Agent(write → execute → check → rewrite)。

    最近更新: 1个月前

搜索帮助