🚀 Windows 11 Qwen3.8-27B 模型本地部署
RTX 5090 24GB + Qwen3.8-27B Q4_K_M + DeepSeek Harness
本教程面向 Windows 11 系统,显卡为 NVIDIA RTX 5090 24GB。假设你已完成 Windows 11 系统安装和 NVIDIA 显卡驱动安装(驱动版本 ≥ 570)。我们将从 CUDA 工具包安装开始,逐步完成 llama.cpp 预编译包部署、Qwen3.8-27B 模型下载,以及 DeepSeek Harness 的安装与配置,最终构建一套完整的本地 AI 开发环境。
1. 安装 CUDA Toolkit
RTX 5090 需要 CUDA 12.8 或更高版本才能完整支持 Blackwell 架构。
访问 NVIDIA CUDA Toolkit 下载页面,选择:
- Operating System:Windows
- Architecture:x86_64
- Version:11(或对应你的 Windows 版本)
- Installer Type:exe (local)
下载安装包(如 cuda_13.3.0_xxx_windows.exe)。
以管理员身份运行安装程序,建议:
- 安装路径保持默认:
C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v13.3 - 组件选择:确保勾选 CUDA 核心组件
- 自定义安装时可只勾选 Runtime 和 Development 相关组件
安装完成后,重启电脑,然后打开新的 PowerShell 验证:
检查版本:
nvcc --version
应显示 CUDA 版本 ≥ 13.3。
conda install cudatoolkit 安装 CUDA,RTX 5090 需要完整的本地 CUDA Toolkit。
2. 安装 Git for Windows
DeepSeek Harness 的源码安装需要 git 命令来克隆仓库。如果你的系统中尚未安装 Git,请按以下步骤操作:
- 访问 Git 官网下载页面,下载 64 位 Windows 安装包(如
Git-2.45.0-64-bit.exe)。 - 运行安装程序,建议保留默认选项,一路 Next 即可(可勾选 “Git from the command line and also from 3rd-party software” 以便在 PowerShell 中使用)。
- 安装完成后,关闭并重新打开 PowerShell,执行以下命令验证:
git --version
应显示 Git 版本号(如 git version 2.45.0.windows.1)。
3. 下载 llama.cpp 预编译包
Windows 下可以直接使用官方提供的预编译二进制文件,省去安装 Visual Studio、CMake 等编译工具的繁琐步骤。
访问 llama.cpp Releases,在 Assets 中找到最新版本(bXXXX),下载对应你显卡的预编译包。
📊 显卡与预编译包选择(性能优先)
| 显卡系列 | 代表型号 | 推荐预编译包 | 性能说明 |
|---|---|---|---|
| RTX 50 系列 | RTX 5090、5080、5070 | cuda-13.3 或更高 |
必须,否则无法驱动显卡 |
| RTX 40 系列 | RTX 4090、4080、4070 | cuda-13.3(性能首选)或 cuda-12.8 |
CUDA 13.3 带来 12-14% 整体性能提升,Prefill 阶段提升高达 38%,并支持 FP8 推理(速度翻倍) |
| RTX 30 系列 | RTX 3090、3080、3070 | cuda-13.3(性能首选)或 cuda-12.8 |
CUDA 13.3 在 Prefill 阶段有 6-9% 提升,Generation 阶段无变化 |
| RTX 20 系列 | RTX 2080、2070、2060 | cuda-12.x |
Turing 架构,CUDA 13 无性能提升,用 12.x 即可 |
| GTX 16 系列 | GTX 1660、1650 | cuda-12.x |
Turing 架构(无 Tensor Core),CUDA 13 无提升 |
| GTX 10 系列 | GTX 1080 Ti、1070 | cuda-12.x(legacy) |
Pascal 架构,不支持 CUDA 13 |
⚠️ 必须同时下载配套 DLL
在 llama.cpp Releases 页面中,你需要下载 两个文件,缺一不可:
- 主程序包:
llama-bXXXX-bin-win-cuda-13.3-x64.zip(或cuda-12版本) - DLL 包:
cudart-llama-bin-win-cuda-13.3-x64.zip(或对应版本)
安装方法
- 将两个压缩包都下载到本地
- 先解压主程序包到你的目录,例如
D:\dev\llm\llama.cpp - 再解压 DLL 包,将其中的所有
.dll文件复制到与llama-server.exe相同的目录下
最终目录结构应类似:
D:\dev\llm\llama.cpp\
├── llama-server.exe
├── llama-cli.exe
├── cudart64_13.dll ← 来自 DLL 包
├── cublas64_13.dll ← 来自 DLL 包
├── cublasLt64_13.dll ← 来自 DLL 包
├── ...(其他 DLL 文件)
└── models\
└── Qwen3.8-27B\
└── qwen3.8-27b-q4_k_m.gguf
llama-server.exe 将无法识别 GPU,只能回退到 CPU 运行,速度会慢很多。
驱动版本要求
使用 cuda-13.3 预编译包要求 NVIDIA 显卡驱动 ≥ 570。在 PowerShell 中运行以下命令检查:
C:\Windows\System32\nvidia-smi.exe
查看列表最上方的 Driver Version。如果低于 570,请前往 NVIDIA 驱动官网 更新。
4. 下载 Qwen3.8-27B Q4_K_M 模型
选择 4-bit 量化版本(Q4_K_M),文件大小约 17-18 GB,完美适配 24GB 显存。
在 llama.cpp 目录下创建模型文件夹并下载:
cd D:\dev\llm\llama.cpp
mkdir models\Qwen3.8-27B
cd models\Qwen3.8-27B
curl -L -O https://huggingface.co/Qwen/Qwen3.8-27B-GGUF/resolve/main/qwen3.8-27b-q4_k_m.gguf
或使用 wget(如已安装):
wget https://huggingface.co/Qwen/Qwen3.8-27B-GGUF/resolve/main/qwen3.8-27b-q4_k_m.gguf
-C - 参数(curl)或 -c 参数(wget)继续下载。
5. 测试推理
cd D:\dev\llm\llama.cpp
.\llama-cli.exe -m .\models\Qwen3.8-27B\qwen3.8-27b-q4_k_m.gguf -ngl 999 -p "你好" -n 32
若能输出中文回复,则编译和模型加载成功。
6. 创建启动脚本(批处理)
在桌面创建 run-qwen.bat 启动脚本,方便一键启动 API 服务。
在桌面空白处右键 → 新建 → 文本文档,命名为 run-qwen.bat(确保扩展名为 .bat),右键编辑,粘贴以下内容(请根据实际路径修改):
@echo off
cd /d D:\dev\llm\llama.cpp
llama-server.exe ^
-m "D:\dev\llm\llama.cpp\models\Qwen3.8-27B\qwen3.8-27b-q4_k_m.gguf" ^
--no-mmap ^
--ctx-size 32768 ^
--flash-attn ^
--batch-size 4096 ^
--ubatch-size 1024 ^
--parallel 1 ^
--host 0.0.0.0 ^
--port 8080 ^
-ngl 999 ^
--threads 16 ^
--threads-batch 16 ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--temp 0.6 ^
--top-p 0.95 ^
--top-k 20 ^
--min-p 0.00 ^
--repeat-penalty 1.1 ^
--jinja ^
--props ^
--metrics ^
--perf
pause
参数说明:
--ctx-size 32768:上下文 32K,安全起点,可根据显存余量调高至 64K--threads 16:根据你的 CPU 核心数适当调整--no-mmap:完全加载到内存/显存,避免磁盘 I/O-ngl 999:所有层卸载到 GPU--host 0.0.0.0:允许本机和局域网访问--flash-attn:启用 Flash Attention 加速--jinja:启用 Jinja 模板支持(用于聊天模板)
^ 作为行续行符,注意 ^ 后面不能有空格或注释。
7. 创建桌面快捷方式
右键点击桌面上的 run-qwen.bat → 发送到 → 桌面快捷方式。
右键该快捷方式 → 属性 → 快捷方式选项卡,可更改图标或调整运行方式(如设置为“最小化”启动)。
双击快捷方式即可启动 Qwen API 服务,服务运行时终端窗口必须保持打开,关闭即终止服务。
8. 安装 DeepSeek Harness
DeepSeek Harness 是 DeepSeek 开源的 AI 智能体框架,采用“一切皆插件”架构,支持接入多种模型(包括本地 Ollama、llama.cpp 和云端 API)。在 Windows 上有两种安装方式:
方式一:源码安装(推荐,功能最新)
8.1 安装 Node.js
DeepSeek Harness 要求 Node.js ≥ v22.19。从 Node.js 官网 下载 LTS 版本(v22.x 或更高)安装。
安装完成后验证:
node --version # 应显示 v22.x.x 或更高
8.2 安装 pnpm
DeepSeek Harness 使用 pnpm 作为包管理器,要求版本 ≥ 11:
npm install -g pnpm
pnpm --version # 应显示 11.x.x 或更高
8.3 克隆并安装依赖
cd D:\dev\llm
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
8.4 构建并启动
pnpm run build
pnpm dsh web
启动成功后,终端会显示访问地址(默认 http://127.0.0.1:3080)。
方式二:桌面应用(更简便)
社区提供了封装好的 Windows 桌面应用,无需配置 Node.js 环境:
- 访问 DeepSeek Harness Desktop Releases
- 下载
DeepSeekHarness-Setup-<版本>.exe - 双击运行安装向导,按提示完成安装(会创建桌面快捷方式)
- 从桌面快捷方式或开始菜单启动
9. 配置本地 Qwen 模型接入 Harness
如果你已通过方式一(源码)启动 Harness,或通过桌面应用启动,可按以下步骤将本地 Qwen 模型接入:
- 确保 llama-server 正在运行(双击桌面
run-qwen.bat快捷方式) - 打开浏览器访问
http://127.0.0.1:3080,进入 Harness Web UI- 首次打开时,会弹出一个要求输入 DeepSeek API Key 的对话框
- 直接点击对话框右上角的 × 或 Cancel 将其关闭(如果只需要本地模型)
- 点击左下角的 Settings(齿轮图标),选择 Models 选项卡
- 点击 Add Custom Model(或类似按钮),填写以下信息:
- Name:
Qwen3.8-27B (Local) - API Base URL:
http://127.0.0.1:8080/v1(注意末尾的/v1) - API Key:留空或输入任意占位符(如
dummy) - Model ID:
qwen3.8-27b-q4_k_m
- Name:
- 点击 Save 保存
之后在聊天界面选择该模型即可使用本地 Qwen 进行对话。
10. 创建 Harness 桌面快捷方式
源码安装版
在桌面空白处右键 → 新建 → 文本文档,命名为 dsh-web.bat,右键编辑,粘贴:
@echo off
cd /d D:\dev\llm\deepseek-harness
pnpm dsh web
pause
右键 dsh-web.bat → 发送到 → 桌面快捷方式,双击即可启动 Harness Web UI。
桌面应用版
安装完成后会自动在桌面和开始菜单创建快捷方式,直接双击启动即可。
11. 常见问题
| 报错现象 | 可能原因 | 解决方案 |
|---|---|---|
nvcc fatal: Unsupported gpu architecture 'sm_120' |
CUDA 版本 < 12.8 | 升级 CUDA 至 12.8 或更高 |
llama-server.exe 闪退或报错 |
CUDA 版本不匹配或缺少 DLL | 确认下载了配套 DLL 包,将所有 .dll 文件放入 llama-server.exe 同级目录 |
CUDA error: out of memory |
模型 + KV Cache 超出 24GB | 降低 --ctx-size(如 16384)或 --batch-size(如 2048) |
| 端口 8080 被占用 | 其他进程使用该端口 | 更改 --port 为其他端口(如 8081) |
pnpm 命令无法识别 |
pnpm 未正确安装或未加入 PATH | npm install -g pnpm 后重启终端 |
git 命令无法识别 |
未安装 Git | 安装 Git for Windows |
| Harness 弹出 API Key 对话框 | 首次启动默认要求云端 Key | 直接关闭对话框,用本地模型即可 |
| Harness 连接不上 Qwen | llama-server 未启动或地址错误 | 确认服务已启动,地址为 :8080/v1 |
| 桌面快捷方式无反应 | 路径错误或权限问题 | 检查 .bat 文件中的路径是否正确 |
| 模型下载中断 | 网络不稳定 | 使用 curl -C - 或 wget -c 续传 |
📊 与 Linux 版本的主要差异
| 对比项 | Linux (Ubuntu) | Windows 11 |
|---|---|---|
| llama.cpp 安装 | 源码编译(git clone + cmake + make) | 直接下载预编译包(.zip 解压即用) |
| 编译依赖 | build-essential, cmake, git | 无需安装(仅需 Git 用于 Harness) |
| 启动脚本 | .sh(Shell 脚本) |
.bat(批处理文件) |
| 路径格式 | /home/ai/... |
D:\dev\llm\... |
| CUDA 安装 | APT 源安装 | 官网下载 .exe 安装包 |
| DeepSeek Harness | 源码安装(Node.js + pnpm) | 源码安装 或 桌面应用(.exe) |
| 桌面快捷方式 | .desktop 文件 |
.bat + 快捷方式 |
🎉 恭喜! 你的 Windows 11 + RTX 5090 + Qwen3.8-27B + DeepSeek Harness 环境已配置完成。
日常使用三步走:
- 双击桌面
run-qwen.bat快捷方式 → 启动 Qwen API 服务(8080端口) - 双击桌面
DeepSeek Harness图标(源码版为dsh-web.bat)→ 启动 Web UI(3080端口) - 浏览器访问
http://127.0.0.1:3080→ 选择本地模型开始对话
评论(0)
暂无评论