本地模型配置教程

用本机模型承担 AI 解析、视觉风格、标题与提示词等文本环节——数据不出本机、不消耗官方服务积分。三种服务任选其一,配置完成后在客户端「模型设置」页一键探测接入。

  1. 安装 LM Studio
    访问官网 lmstudio.io 下载 Windows 版并安装。
  2. 下载视觉模型(关键)
    在「搜索」页搜索 qwen2.5-vl-7b-instruct(GGUF 格式)并下载。必须选带 VL 的视觉模型——纯文本模型无法完成「AI 解析商品信息」。
  3. 启动本地服务
    左侧切到 Developer 页 → 选择已下载的模型 → 点击 Start Server(默认端口 1234)。建议打开「保持运行」,避免闲置自动关闭。
  4. 回到客户端探测
    打开「模型设置」页 → 本地模型区域点击 🔍 探测本机服务 → 选中探测到的服务点「一键使用」。
  1. 安装 Ollama
    访问 ollama.com 下载 Windows 版,安装后自动在后台运行。
  2. 拉取视觉模型(关键)
    命令行执行下方命令下载视觉模型(约 6GB)。必须带视觉能力(qwen2.5vl / llava 等多模态系列)。
  3. 确认服务在运行
    Ollama 安装后默认开机自启(端口 11434)。若提示连接失败,执行第二条命令手动启动。
  4. 回到客户端探测
    「模型设置」页 → 探测本机服务 → 一键使用。
ollama pull qwen2.5vl:7b
ollama serve
第一条:拉取视觉模型;第二条:手动启动服务(默认已自启可跳过)。
  1. 下载 llama-server
    到 GitHub 的 ggml-org/llama.cpp 仓库 Releases 页,下载 llama-*-bin-win-cuda-*.zip,解压得到 llama-server.exe
  2. 下载模型与视觉投影文件(关键)
    从 HuggingFace 下载多模态 GGUF:主模型(如 gemma-3-12b-it-Q4_K_M.gguf)+ 配套的视觉投影文件mmproj-*.gguf,与主模型同一仓库)。两者缺一不可。
  3. 启动服务
    命令行进入解压目录,执行下方命令(按实际文件名替换)。看到 "server is listening" 即启动成功。
  4. 回到客户端探测
    「模型设置」页 → 探测本机服务(llama.cpp,端口 8080)→ 一键使用。
llama-server -m 模型.gguf --mmproj 视觉投影.gguf --host 127.0.0.1 --port 8080 -c 16384 -ngl 99
--mmproj 视觉投影必须提供,否则无法解析商品图;-c 16384 为上下文长度(带图解析建议 ≥16K);-ngl 99 表示全部层放入显存(无独显可去掉此参数改用 CPU,速度会明显变慢)。
三个关键点:① 必须是视觉(VL / 多模态)模型,纯文本模型无法解析商品图;② llama.cpp 必须加 --mmproj 视觉投影参数③ 上下文建议 ≥16K(商品图会占用大量上下文)。

常见问题

遇到问题先对照这里排查

提示「无法连接到接口地址」

本地服务没有启动,或端口与客户端配置不一致。回到「模型设置」页重新探测一次即可自动回填正确的地址与端口。

能连上,但「AI 解析商品信息」总是失败

大概率用了纯文本模型——商品解析需要"看图",必须使用视觉(VL / 多模态)模型;llama.cpp 用户检查是否漏了 --mmproj 参数。

提示「LLM 结构化输出解析失败」

模型偏小导致 JSON 输出不稳定。客户端已内置自动重试与修复,仍失败建议换 7B 及以上模型,或重试一次。

显存不够怎么办

7B Q4 量化模型约需 6GB 显存。显存不足可:换更小的量化版本(Q4 → Q3)、减少 llama.cpp 的 -ngl 层数,或去掉该参数改用 CPU 模式(速度明显变慢)。

本地模型负责哪些环节?生图也走本地吗?

本地模型承担全部文本环节:AI 解析、视觉风格、标题、提示词(不消耗官方服务积分)。生图走官方网关按张计费,或在模型设置中改用你自己的生图接口。