@编程小助手
微信: leikooo_
·06-01 16:28今天在本地跑通 Qwen3.6 了!
使用的工具是 llama.cpp https://github.com/ggml-org/llama.cpp
还踩了一些坑,比如识别不到 GPU 只能由 CPU 跑的情况(有没有识别到可以在对话的时候看一下 GPU 系统占用就知道了)
查看自己 cuda 版本 nvidia-smi 就可以看到自己的版本,后面下载的时候下载相同的版本即可,比如我运行的结果是这样的 CUDA UMD Version: 13.3 所以需要下载 CUDA 13
C:\Users\leikooo>nvidia-smi
Mon Jun 1 16:30:40 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 610.47 KMD Version: 610.47 CUDA UMD Version: 13.3 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Driver-Model | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 NVIDIA GeForce RTX 4060 ... WDDM | 00000000:01:00.0 On | N/A |
| N/A 52C P0 15W / 95W | 1205MiB / 8188MiB | 1% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
下载的时候需要下载对应自己 cuda 的版本 Windows x64 (CUDA 13) 和 CUDA 13.3 DLLs(一定要下载),两个下载完成之后需要把 CUDA 13.3 DLLs 解压的内容放到 Windows x64 (CUDA 13) 解压的里面才可以正确识别到 GPU 。下载链接 Github Releases https://github.com/ggml-org/llama.cpp/releases/tag/b9442
最后附上系统占用的情况,因为跑的是 35B 的所以占用几乎全都满了
PS 启动命令 llama-server.exe -m "xxx.gguf" -ngl 999 -c 20000 --cache-type-k q4_0 --cache-type-v q4_0 --host 127.0.0.1 --port 8080 --jinja (执行这段命令可以在下载完模型的 gguf 文件的文件夹执行,只需要把这个 xxx.gguf 改成真实模型的名字即可)
9
3
分享
操作
评论
相关内容
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
