leikooo
@编程小助手 微信: leikooo_
·06-01 16:28
今天在本地跑通 Qwen3.6 了! 使用的工具是 llama.cpp https://github.com/ggml-org/llama.cpp 还踩了一些坑,比如识别不到 GPU 只能由 CPU 跑的情况(有没有识别到可以在对话的时候看一下 GPU 系统占用就知道了) 查看自己 cuda 版本 nvidia-smi 就可以看到自己的版本,后面下载的时候下载相同的版本即可,比如我运行的结果是这样的 CUDA UMD Version: 13.3 所以需要下载 CUDA 13 C:\Users\leikooo>nvidia-smi Mon Jun 1 16:30:40 2026 +-----------------------------------------------------------------------------------------+ | NVIDIA-SMI 610.47 KMD Version: 610.47 CUDA UMD Version: 13.3 | +-----------------------------------------+------------------------+----------------------+ | GPU Name Driver-Model | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |=========================================+========================+======================| | 0 NVIDIA GeForce RTX 4060 ... WDDM | 00000000:01:00.0 On | N/A | | N/A 52C P0 15W / 95W | 1205MiB / 8188MiB | 1% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ 下载的时候需要下载对应自己 cuda 的版本 Windows x64 (CUDA 13) 和 CUDA 13.3 DLLs(一定要下载),两个下载完成之后需要把 CUDA 13.3 DLLs 解压的内容放到 Windows x64 (CUDA 13) 解压的里面才可以正确识别到 GPU 。下载链接 Github Releases https://github.com/ggml-org/llama.cpp/releases/tag/b9442 最后附上系统占用的情况,因为跑的是 35B 的所以占用几乎全都满了 PS 启动命令 llama-server.exe -m "xxx.gguf" -ngl 999 -c 20000 --cache-type-k q4_0 --cache-type-v q4_0 --host 127.0.0.1 --port 8080 --jinja (执行这段命令可以在下载完模型的 gguf 文件的文件夹执行,只需要把这个 xxx.gguf 改成真实模型的名字即可)
0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
下载 APP