本地模型配置教程
用本机模型承担 AI 解析、视觉风格、标题与提示词等文本环节——数据不出本机、不消耗官方服务积分。三种服务任选其一,配置完成后在客户端「模型设置」页一键探测接入。
- 安装 LM Studio
访问官网 lmstudio.io 下载 Windows 版并安装。
- 下载视觉模型(关键)
在「搜索」页搜索 qwen2.5-vl-7b-instruct(GGUF 格式)并下载。必须选带 VL 的视觉模型——纯文本模型无法完成「AI 解析商品信息」。
- 启动本地服务
左侧切到 Developer 页 → 选择已下载的模型 → 点击 Start Server(默认端口 1234)。建议打开「保持运行」,避免闲置自动关闭。
- 回到客户端探测
打开「模型设置」页 → 本地模型区域点击 🔍 探测本机服务 → 选中探测到的服务点「一键使用」。
- 安装 Ollama
访问 ollama.com 下载 Windows 版,安装后自动在后台运行。
- 拉取视觉模型(关键)
命令行执行下方命令下载视觉模型(约 6GB)。必须带视觉能力(qwen2.5vl / llava 等多模态系列)。
- 确认服务在运行
Ollama 安装后默认开机自启(端口 11434)。若提示连接失败,执行第二条命令手动启动。
- 回到客户端探测
「模型设置」页 → 探测本机服务 → 一键使用。
ollama pull qwen2.5vl:7b
ollama serve
第一条:拉取视觉模型;第二条:手动启动服务(默认已自启可跳过)。
- 下载 llama-server
到 GitHub 的 ggml-org/llama.cpp 仓库 Releases 页,下载 llama-*-bin-win-cuda-*.zip,解压得到 llama-server.exe。
- 下载模型与视觉投影文件(关键)
从 HuggingFace 下载多模态 GGUF:主模型(如 gemma-3-12b-it-Q4_K_M.gguf)+ 配套的视觉投影文件(mmproj-*.gguf,与主模型同一仓库)。两者缺一不可。
- 启动服务
命令行进入解压目录,执行下方命令(按实际文件名替换)。看到 "server is listening" 即启动成功。
- 回到客户端探测
「模型设置」页 → 探测本机服务(llama.cpp,端口 8080)→ 一键使用。
llama-server -m 模型.gguf --mmproj 视觉投影.gguf --host 127.0.0.1 --port 8080 -c 16384 -ngl 99
--mmproj 视觉投影必须提供,否则无法解析商品图;-c 16384 为上下文长度(带图解析建议 ≥16K);-ngl 99 表示全部层放入显存(无独显可去掉此参数改用 CPU,速度会明显变慢)。
三个关键点:① 必须是视觉(VL / 多模态)模型,纯文本模型无法解析商品图;② llama.cpp 必须加 --mmproj 视觉投影参数;③ 上下文建议 ≥16K(商品图会占用大量上下文)。
常见问题
遇到问题先对照这里排查
提示「无法连接到接口地址」
本地服务没有启动,或端口与客户端配置不一致。回到「模型设置」页重新探测一次即可自动回填正确的地址与端口。
能连上,但「AI 解析商品信息」总是失败
大概率用了纯文本模型——商品解析需要"看图",必须使用视觉(VL / 多模态)模型;llama.cpp 用户检查是否漏了 --mmproj 参数。
提示「LLM 结构化输出解析失败」
模型偏小导致 JSON 输出不稳定。客户端已内置自动重试与修复,仍失败建议换 7B 及以上模型,或重试一次。
显存不够怎么办
7B Q4 量化模型约需 6GB 显存。显存不足可:换更小的量化版本(Q4 → Q3)、减少 llama.cpp 的 -ngl 层数,或去掉该参数改用 CPU 模式(速度明显变慢)。
本地模型负责哪些环节?生图也走本地吗?
本地模型承担全部文本环节:AI 解析、视觉风格、标题、提示词(不消耗官方服务积分)。生图走官方网关按张计费,或在模型设置中改用你自己的生图接口。