boxmoe_header_banner_img

Hello! 欢迎来到我的博客!

文章导读

🚀 Windows 11 Qwen3.8-27B 模型本地部署


avatar
[email protected] 27 8 月, 2026 21

🚀 Windows 11 Qwen3.8-27B 模型本地部署

RTX 5090 24GB + Qwen3.8-27B Q4_K_M + DeepSeek Harness

本教程面向 Windows 11 系统,显卡为 NVIDIA RTX 5090 24GB。假设你已完成 Windows 11 系统安装和 NVIDIA 显卡驱动安装(驱动版本 ≥ 570)。我们将从 CUDA 工具包安装开始,逐步完成 llama.cpp 预编译包部署、Qwen3.8-27B 模型下载,以及 DeepSeek Harness 的安装与配置,最终构建一套完整的本地 AI 开发环境。


1. 安装 CUDA Toolkit

RTX 5090 需要 CUDA 12.8 或更高版本才能完整支持 Blackwell 架构。

访问 NVIDIA CUDA Toolkit 下载页面,选择:

  • Operating System:Windows
  • Architecture:x86_64
  • Version:11(或对应你的 Windows 版本)
  • Installer Type:exe (local)

下载安装包(如 cuda_13.3.0_xxx_windows.exe)。

以管理员身份运行安装程序,建议:

  • 安装路径保持默认:C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v13.3
  • 组件选择:确保勾选 CUDA 核心组件
  • 自定义安装时可只勾选 Runtime 和 Development 相关组件

安装完成后,重启电脑,然后打开新的 PowerShell 验证:

检查版本:

nvcc --version

应显示 CUDA 版本 ≥ 13.3。

⚠️ 重要: 不要通过 conda install cudatoolkit 安装 CUDA,RTX 5090 需要完整的本地 CUDA Toolkit。

2. 安装 Git for Windows

DeepSeek Harness 的源码安装需要 git 命令来克隆仓库。如果你的系统中尚未安装 Git,请按以下步骤操作:

  1. 访问 Git 官网下载页面,下载 64 位 Windows 安装包(如 Git-2.45.0-64-bit.exe)。
  2. 运行安装程序,建议保留默认选项,一路 Next 即可(可勾选 “Git from the command line and also from 3rd-party software” 以便在 PowerShell 中使用)。
  3. 安装完成后,关闭并重新打开 PowerShell,执行以下命令验证:
git --version

应显示 Git 版本号(如 git version 2.45.0.windows.1)。

💡 如果不想安装 Git,你也可以直接下载 Harness 的 桌面应用版(见第 8 节方式二),无需使用 Git。

3. 下载 llama.cpp 预编译包

Windows 下可以直接使用官方提供的预编译二进制文件,省去安装 Visual Studio、CMake 等编译工具的繁琐步骤。

访问 llama.cpp Releases,在 Assets 中找到最新版本(bXXXX),下载对应你显卡的预编译包。

📊 显卡与预编译包选择(性能优先)

显卡系列 代表型号 推荐预编译包 性能说明
RTX 50 系列 RTX 5090、5080、5070 cuda-13.3 或更高 必须,否则无法驱动显卡
RTX 40 系列 RTX 4090、4080、4070 cuda-13.3(性能首选)
cuda-12.8
CUDA 13.3 带来 12-14% 整体性能提升,Prefill 阶段提升高达 38%,并支持 FP8 推理(速度翻倍)
RTX 30 系列 RTX 3090、3080、3070 cuda-13.3(性能首选)
cuda-12.8
CUDA 13.3 在 Prefill 阶段有 6-9% 提升,Generation 阶段无变化
RTX 20 系列 RTX 2080、2070、2060 cuda-12.x Turing 架构,CUDA 13 无性能提升,用 12.x 即可
GTX 16 系列 GTX 1660、1650 cuda-12.x Turing 架构(无 Tensor Core),CUDA 13 无提升
GTX 10 系列 GTX 1080 Ti、1070 cuda-12.x(legacy) Pascal 架构,不支持 CUDA 13
💡 追求性能就选 cuda-13.3(RTX 30/40/50 系)。CUDA 13.3 的优化重心在 RTX 40/50 系列,RTX 30 系有少量提升,RTX 20 系及更早无提升。

⚠️ 必须同时下载配套 DLL

在 llama.cpp Releases 页面中,你需要下载 两个文件,缺一不可:

  1. 主程序包llama-bXXXX-bin-win-cuda-13.3-x64.zip(或 cuda-12 版本)
  2. DLL 包cudart-llama-bin-win-cuda-13.3-x64.zip(或对应版本)

安装方法

  1. 将两个压缩包都下载到本地
  2. 先解压主程序包到你的目录,例如 D:\dev\llm\llama.cpp
  3. 再解压 DLL 包,将其中的所有 .dll 文件复制到与 llama-server.exe 相同的目录下

最终目录结构应类似:

D:\dev\llm\llama.cpp\
├── llama-server.exe
├── llama-cli.exe
├── cudart64_13.dll      ← 来自 DLL 包
├── cublas64_13.dll      ← 来自 DLL 包
├── cublasLt64_13.dll    ← 来自 DLL 包
├── ...(其他 DLL 文件)
└── models\
    └── Qwen3.8-27B\
        └── qwen3.8-27b-q4_k_m.gguf
⚠️ 如果不放入这些 DLL 文件,llama-server.exe无法识别 GPU,只能回退到 CPU 运行,速度会慢很多。

驱动版本要求

使用 cuda-13.3 预编译包要求 NVIDIA 显卡驱动 ≥ 570。在 PowerShell 中运行以下命令检查:

C:\Windows\System32\nvidia-smi.exe

查看列表最上方的 Driver Version。如果低于 570,请前往 NVIDIA 驱动官网 更新。


4. 下载 Qwen3.8-27B Q4_K_M 模型

选择 4-bit 量化版本(Q4_K_M),文件大小约 17-18 GB,完美适配 24GB 显存。

llama.cpp 目录下创建模型文件夹并下载:

cd D:\dev\llm\llama.cpp
mkdir models\Qwen3.8-27B
cd models\Qwen3.8-27B
curl -L -O https://huggingface.co/Qwen/Qwen3.8-27B-GGUF/resolve/main/qwen3.8-27b-q4_k_m.gguf

或使用 wget(如已安装):

wget https://huggingface.co/Qwen/Qwen3.8-27B-GGUF/resolve/main/qwen3.8-27b-q4_k_m.gguf
💡 如果链接失效,请访问 Qwen3.8-27B-GGUF 页面 获取最新下载地址。
⚠️ 下载过程中请确保网络稳定。如果下载中断,可添加 -C - 参数(curl)或 -c 参数(wget)继续下载。

5. 测试推理

cd D:\dev\llm\llama.cpp
.\llama-cli.exe -m .\models\Qwen3.8-27B\qwen3.8-27b-q4_k_m.gguf -ngl 999 -p "你好" -n 32

若能输出中文回复,则编译和模型加载成功。


6. 创建启动脚本(批处理)

在桌面创建 run-qwen.bat 启动脚本,方便一键启动 API 服务。

在桌面空白处右键 → 新建文本文档,命名为 run-qwen.bat(确保扩展名为 .bat),右键编辑,粘贴以下内容(请根据实际路径修改):

@echo off
cd /d D:\dev\llm\llama.cpp

llama-server.exe ^
  -m "D:\dev\llm\llama.cpp\models\Qwen3.8-27B\qwen3.8-27b-q4_k_m.gguf" ^
  --no-mmap ^
  --ctx-size 32768 ^
  --flash-attn ^
  --batch-size 4096 ^
  --ubatch-size 1024 ^
  --parallel 1 ^
  --host 0.0.0.0 ^
  --port 8080 ^
  -ngl 999 ^
  --threads 16 ^
  --threads-batch 16 ^
  --cache-type-k q8_0 ^
  --cache-type-v q8_0 ^
  --temp 0.6 ^
  --top-p 0.95 ^
  --top-k 20 ^
  --min-p 0.00 ^
  --repeat-penalty 1.1 ^
  --jinja ^
  --props ^
  --metrics ^
  --perf

pause

参数说明:

  • --ctx-size 32768:上下文 32K,安全起点,可根据显存余量调高至 64K
  • --threads 16:根据你的 CPU 核心数适当调整
  • --no-mmap:完全加载到内存/显存,避免磁盘 I/O
  • -ngl 999:所有层卸载到 GPU
  • --host 0.0.0.0:允许本机和局域网访问
  • --flash-attn:启用 Flash Attention 加速
  • --jinja:启用 Jinja 模板支持(用于聊天模板)
💡 Windows 批处理中使用 ^ 作为行续行符,注意 ^ 后面不能有空格或注释。

7. 创建桌面快捷方式

右键点击桌面上的 run-qwen.bat发送到桌面快捷方式

右键该快捷方式 → 属性快捷方式选项卡,可更改图标或调整运行方式(如设置为“最小化”启动)。

双击快捷方式即可启动 Qwen API 服务,服务运行时终端窗口必须保持打开,关闭即终止服务。


8. 安装 DeepSeek Harness

DeepSeek Harness 是 DeepSeek 开源的 AI 智能体框架,采用“一切皆插件”架构,支持接入多种模型(包括本地 Ollama、llama.cpp 和云端 API)。在 Windows 上有两种安装方式:

方式一:源码安装(推荐,功能最新)

8.1 安装 Node.js

DeepSeek Harness 要求 Node.js ≥ v22.19。从 Node.js 官网 下载 LTS 版本(v22.x 或更高)安装。

安装完成后验证:

node --version   # 应显示 v22.x.x 或更高

8.2 安装 pnpm

DeepSeek Harness 使用 pnpm 作为包管理器,要求版本 ≥ 11

npm install -g pnpm
pnpm --version   # 应显示 11.x.x 或更高

8.3 克隆并安装依赖

cd D:\dev\llm
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install

8.4 构建并启动

pnpm run build
pnpm dsh web

启动成功后,终端会显示访问地址(默认 http://127.0.0.1:3080)。

⚠️ 注意: 此终端窗口需要保持打开,关闭会导致服务终止。

方式二:桌面应用(更简便)

社区提供了封装好的 Windows 桌面应用,无需配置 Node.js 环境:

  1. 访问 DeepSeek Harness Desktop Releases
  2. 下载 DeepSeekHarness-Setup-<版本>.exe
  3. 双击运行安装向导,按提示完成安装(会创建桌面快捷方式)
  4. 从桌面快捷方式或开始菜单启动
💡 桌面应用为社区维护的非官方版本,更新可能滞后于源码。追求最新功能请使用源码编译。

9. 配置本地 Qwen 模型接入 Harness

如果你已通过方式一(源码)启动 Harness,或通过桌面应用启动,可按以下步骤将本地 Qwen 模型接入:

  1. 确保 llama-server 正在运行(双击桌面 run-qwen.bat 快捷方式)
  2. 打开浏览器访问 http://127.0.0.1:3080,进入 Harness Web UI
    • 首次打开时,会弹出一个要求输入 DeepSeek API Key 的对话框
    • 直接点击对话框右上角的 × 或 Cancel 将其关闭(如果只需要本地模型)
  3. 点击左下角的 Settings(齿轮图标),选择 Models 选项卡
  4. 点击 Add Custom Model(或类似按钮),填写以下信息:
    • NameQwen3.8-27B (Local)
    • API Base URLhttp://127.0.0.1:8080/v1(注意末尾的 /v1
    • API Key:留空或输入任意占位符(如 dummy
    • Model IDqwen3.8-27b-q4_k_m
  5. 点击 Save 保存

之后在聊天界面选择该模型即可使用本地 Qwen 进行对话。

💡 如果 llama-server 未启动,Harness 无法连接。可在 Harness 中同时保留 DeepSeek 云端模型和本地模型,按需切换。

10. 创建 Harness 桌面快捷方式

源码安装版

在桌面空白处右键 → 新建文本文档,命名为 dsh-web.bat,右键编辑,粘贴:

@echo off
cd /d D:\dev\llm\deepseek-harness
pnpm dsh web
pause

右键 dsh-web.bat发送到桌面快捷方式,双击即可启动 Harness Web UI。

桌面应用版

安装完成后会自动在桌面和开始菜单创建快捷方式,直接双击启动即可。


11. 常见问题

报错现象 可能原因 解决方案
nvcc fatal: Unsupported gpu architecture 'sm_120' CUDA 版本 < 12.8 升级 CUDA 至 12.8 或更高
llama-server.exe 闪退或报错 CUDA 版本不匹配或缺少 DLL 确认下载了配套 DLL 包,将所有 .dll 文件放入 llama-server.exe 同级目录
CUDA error: out of memory 模型 + KV Cache 超出 24GB 降低 --ctx-size(如 16384)或 --batch-size(如 2048)
端口 8080 被占用 其他进程使用该端口 更改 --port 为其他端口(如 8081)
pnpm 命令无法识别 pnpm 未正确安装或未加入 PATH npm install -g pnpm 后重启终端
git 命令无法识别 未安装 Git 安装 Git for Windows
Harness 弹出 API Key 对话框 首次启动默认要求云端 Key 直接关闭对话框,用本地模型即可
Harness 连接不上 Qwen llama-server 未启动或地址错误 确认服务已启动,地址为 :8080/v1
桌面快捷方式无反应 路径错误或权限问题 检查 .bat 文件中的路径是否正确
模型下载中断 网络不稳定 使用 curl -C -wget -c 续传

📊 与 Linux 版本的主要差异

对比项 Linux (Ubuntu) Windows 11
llama.cpp 安装 源码编译(git clone + cmake + make) 直接下载预编译包(.zip 解压即用)
编译依赖 build-essential, cmake, git 无需安装(仅需 Git 用于 Harness)
启动脚本 .sh(Shell 脚本) .bat(批处理文件)
路径格式 /home/ai/... D:\dev\llm\...
CUDA 安装 APT 源安装 官网下载 .exe 安装包
DeepSeek Harness 源码安装(Node.js + pnpm) 源码安装 或 桌面应用(.exe)
桌面快捷方式 .desktop 文件 .bat + 快捷方式

🎉 恭喜! 你的 Windows 11 + RTX 5090 + Qwen3.8-27B + DeepSeek Harness 环境已配置完成。

日常使用三步走:

  1. 双击桌面 run-qwen.bat 快捷方式 → 启动 Qwen API 服务(8080 端口)
  2. 双击桌面 DeepSeek Harness 图标(源码版为 dsh-web.bat)→ 启动 Web UI(3080 端口)
  3. 浏览器访问 http://127.0.0.1:3080 → 选择本地模型开始对话



评论(0)

查看评论列表

暂无评论


发表评论

表情 颜文字
插入代码