ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

如何用 DwarfStar 搭建本地 OpenAI 兼容推理服务器:完整指南

如何用 DwarfStar 搭建本地 OpenAI 兼容推理服务器:完整指南 如何用 DwarfStar 搭建本地 OpenAI 兼容推理服务器完整指南【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4DwarfStar 是一款面向消费级硬件的本地大模型推理引擎专注优化 DeepSeek V4 Flash、DeepSeek V4 PRO 与 GLM 5.x 模型。它内置 HTTP 服务端一条命令即可在 Mac、NVIDIA 显卡或 AMD 机器上启动 OpenAI 兼容的本地推理服务器让现有客户端代码零改动接入。本文带你完成从零搭建到接入编程工具的完整流程。一、DwarfStar 是什么适合谁用DwarfStar仓库代号ds4不是一个通用的 GGUF 运行器而是一个小而快的专用推理引擎专精少数顶尖模型DeepSeek V4 Flash / V4.1 Flash / PRO、GLM 5.2 / 5.3 及其 Flash 版本多后端支持MetalApple Silicon主力目标、NVIDIA CUDA含 DGX Spark、多卡 L40S、ROCmStrix Halo开箱即用的服务端ds4-server提供 OpenAI 风格 Chat Completions、Responses 与 Anthropic 风格接口内存不够也能跑SSD 流式加载让大模型跑在小内存机器上你的硬件是否适合96/128 GB 内存的 Mac✅ 首选跑 Flash Q2 非常顺滑NVIDIA 显卡含 Ada/L40S✅ 可组多卡多人推理服务器DGX Spark✅ 官方主打平台之一Strix HaloAMD✅ ROCm 后端支持二、一键克隆仓库并下载模型 第一步永远是拿到源码和模型。在项目根目录执行git clone https://gitcode.com/GitHub_Trending/ds4/ds4 cd ds4然后用自带的下载脚本拉取模型最常用的是ds4f-q2约 81 GB推荐 96/128 GB 内存机器的起点。脚本支持断点续传中断后重跑同一命令即可./download_model.sh ds4f-q2下载完成后ds4flash.gguf链接会自动指向该模型后续所有命令可直接使用默认模型。完整的下载目标清单Q4、MXFP4、GLM 5.3 等见 download_model.sh内存与型号匹配建议见 docs/MODELS.md。三、按平台选择最快的构建命令构建目标由 Makefile 管理根据你的平台四选一平台构建命令官方指南Apple SiliconMetalmakedocs/METAL.mdDGX Sparkmake cuda-sparkdocs/DGX_SPARK.md单张或多张 CUDA 卡make cuda-genericdocs/CUDA_MULTI_GPU.mdStrix Halo / Framework Desktopmake strix-halodocs/STRIX_HALO.md一次构建会同时产出ds4交互式 CLI、ds4-server推理服务器、ds4-agent编码代理、ds4-bench与ds4-eval。CUDA 平台若编译或启动报错可参考下面这张终端截图排查环境变量四、三步启动本地 OpenAI 兼容服务器这是全文最关键的部分只需三步第 1 步启动服务器./ds4-server --ctx 32768默认监听http://127.0.0.1:8000。对外提供服务时加--host 0.0.0.0并建议在前面加一层认证与 TLS。第 2 步确认模型已加载curl http://127.0.0.1:8000/v1/models第 3 步发起 OpenAI 风格对话请求curl http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:deepseek-v4-flash,messages:[{role:user,content:Explain Redis streams.}],stream:true}服务器支持的接口一览详见 docs/SERVER.md端点用途GET /v1/models查看已加载模型信息POST /v1/chat/completionsOpenAI 风格对话支持 SSE 流式、工具调用POST /v1/responsesResponses 风格请求与续写POST /v1/completions文本补全POST /v1/messagesAnthropic 风格消息接口几个实用的默认行为采样参数默认 temperature 1、top-p 1、min-p 0.05DeepSeek 默认开启思考模式请求中用think:false可获得直接回答支持标准采样字段与输出预算字段请求内参数优先于默认值。五、多用户并发会话批量参数想让团队多人共用这台本地推理服务器用--batched-session预分配多个独立 KV 会话槽位槽位占用时请求自动排队./ds4-server --ctx 4096 --batched-session 4注意上下文大小和槽位数要一起规划放得下一次 4096 上下文不一定放得下四次。官方八卡 L40S 配置用--batched-session 16可达到约 126 t/s 的总生成吞吐16 个并发会话的合计值配置方法见 docs/CUDA_MULTI_GPU.md 的 Serve multiple users 小节。六、可选进阶加速、视觉与编程工具接入 磁盘 KV 缓存——保存会话前缀跨重启复用长会话提速明显./ds4-server --ctx 100000 \ --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192️ 图片理解——搭配对应的视觉编码器--vision FILE启动后OpenAI Chat 与 Responses 接口接受内联 PNG/JPEG data URI每次请求最多 16 张图。下面这张车票图片就是典型的图片输入测试样例本地模型可以读出车次、检票口与登机信息 接入编程工具——Pi、OpenCode、Codex CLI、Claude Code 只需把 base URL 指向http://127.0.0.1:8000/v1四种工具的完整配置片段都写在 docs/CLIENTS.md 里复制粘贴即可。七、常见排查清单内存不够改用 SSD 流式加载--ssd-streaming参考 docs/SSD_STREAMING.md找不到模型显式传-m FILE或用--chdir /path/to/ds4指定项目根目录想要更高性能跑./ds4-bench测量基线数据见 docs/PERFORMANCE.md验证正确性./ds4-eval -m ds4flash.gguf --suite core内置回归测试完整功能文档README.md 的 Detailed Guides 一节汇总了全部专题指南从克隆仓库到第一条 OpenAI 风格请求返回全程不超过 10 分钟。DwarfStar 的哲学很直接与其做一个万能的 GGUF 运行器不如把几个最好的模型在你的机器上跑到极致。【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进