Continue插件配置

本地模型是 llama.cpp + models Qwen3.8-27B-UD-Q4_K_M.gguf + mmproj-F16.gguf 方式部署启动的,如何向Cline、Continue中配置


你的 llama.cpp 部署方式,可以通过配置让 Cline 和 Continue 使用本地模型。关键在于 llama.cpp 提供了与 OpenAI 兼容的 API 接口,所以两个插件都可以通过 OpenAI Compatible 方式接入。

⚙️ 启动 llama.cpp 服务器

在配置插件前,需要先启动 llama-server。一个基础的启动命令如下:

./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080
  • -m:指定你的模型文件路径。
  • --port 8080:指定服务端口,后续配置需要用到。

注意:如果模型支持 --jinja 模板,或需要加载 mmproj 文件(用于多模态),请根据实际情况添加相应参数。


🧩 配置 Cline

Cline 没有内置的 llama.cpp 选项,需要选择 OpenAI Compatible 来接入。

步骤:

  1. 在 VSCode 中点击 Cline 图标,进入设置(齿轮图标)。
  2. API Provider 下拉菜单选择 OpenAI Compatible
  3. 填写以下信息:
    • Base URLhttp://localhost:8080/v1务必加上 /v1)。
    • API Key:输入任意字符串,如 not-needed(本地服务不验证)。
    • Model IDQwen3.8-27B-UD-Q4_K_M(或任意能帮助你识别的名称)。

保存后即可使用。


🧩 配置 Continue

Continue 支持两种配置方式,推荐使用更灵活的 YAML 配置文件

方法一:使用 YAML 配置文件(推荐)

在项目根目录下创建 .continue/models/ 文件夹,并新建一个 llama.yaml 文件。填入以下内容:

name: Local Llama.cpp
version: 1.0.0
schema: v1
models:
  - name: Qwen3.8-27B
    provider: llama.cpp
    model: Qwen3.8-27B-UD-Q4_K_M.gguf
    apiBase: http://localhost:8080
    roles:
      - chat
      - edit
      - autocomplete  # 如果需要代码补全功能
    defaultCompletionOptions:
      contextLength: 8192

保存后,Continue 会自动识别配置。

方法二:通过 VSCode 设置

  1. 打开 VSCode 设置(Ctrl+,),搜索 continue
  2. 找到 Continue: Config 设置,点击 Edit in settings.json
  3. 在配置文件中添加类似如下的条目:
    {
      "continue.models": [
        {
          "title": "Qwen3.8-27B (Local)",
          "provider": "llama.cpp",
          "model": "Qwen3.8-27B-UD-Q4_K_M.gguf",
          "apiBase": "http://localhost:8080"
        }
      ]
    }
    

⚠️ 重要注意事项

  • 工具调用(Tool Calls)限制llama.cpp 的工具调用支持可能不完善,复杂任务(如自动创建文件)可能不如云端模型稳定。
  • 代码补全优化:如果要用作代码补全模型,可在配置中加上 roles: [autocomplete] 角色,并设置 autocompleteOptions 参数优化体验。
  • 模型性能:27B 模型较大,在 CPU 上运行可能较慢,请合理设置上下文长度 (contextLength)。
  • 端口与地址:确保 apiBase 的端口与 llama-server 启动时指定的 --port 一致。

如果遇到连接问题,可以先在浏览器中访问 http://localhost:8080/v1/models,看是否能返回模型列表,以此确认服务是否正常运行。


Continue的配置参考

这份配置存在多处错误,主要是 useLegacyCompletionsEndpoint 字段位置错误,以及部分模型参数定义不规范。我帮你重写了一份修正版:

name: Main Config
version: 1.0.0
schema: v1
models:
  # =====================================================
  # 主模型:Qwen3.8-27B(聊天+编辑+应用)
  # =====================================================
  - name: Qwen3.8-27B (Local)
    provider: llama.cpp
    model: qwen3.8
    apiKey: sk-qwen-local-2026
    apiBase: http://172.17.10.167:8080/v1
    roles:
      - chat
      - edit
      - apply
    defaultCompletionOptions:
      contextLength: 8192               # 27B模型建议先设8192,稳定后可逐步调大
      maxTokens: 4096                   # 单次最大生成长度
      temperature: 0.7
      topP: 0.95
    useLegacyCompletionsEndpoint: false

  # =====================================================
  # 长上下文模型(仅聊天,用于文档分析)
  # =====================================================
  - name: Qwen3.8-27B (Long Context)
    provider: llama.cpp
    model: qwen3.8
    apiKey: sk-qwen-local-2026
    apiBase: http://172.17.10.167:8080/v1
    roles:
      - chat
    defaultCompletionOptions:
      contextLength: 32768              # 长上下文,量力而行
      maxTokens: 4096
      temperature: 0.5
    useLegacyCompletionsEndpoint: false

  # =====================================================
  # 快速响应模型(轻量编辑任务)
  # =====================================================
  - name: Qwen3.8-27B (Fast)
    provider: llama.cpp
    model: qwen3.8
    apiKey: sk-qwen-local-2026
    apiBase: http://172.17.10.167:8080/v1
    roles:
      - edit
      - apply
    defaultCompletionOptions:
      contextLength: 4096
      maxTokens: 2048
      temperature: 0.3
    useLegacyCompletionsEndpoint: false

🔧 主要修正说明

错误点 原因 修复方案
useLegacyCompletionsEndpoint 位置错误 该字段属于模型级配置,不能放在 defaultCompletionOptions 内部 提升到与 providermodel 同级
contextLength: 1047576 过大 llama.cpp 本地服务支持不了百万级上下文 27B 模型建议先设 8192,根据实际显存/内存情况逐步调大
maxTokens: 32768/100000 过大 单次生成超长输出容易超时或 OOM 建议设为 4096 以内
capabilities: [image_input] 无效 llama.cpp + Qwen3.8 不支持多模态 已移除该字段
模型命名混淆 三个模型都叫 OpenAI GPT-4.1 容易混淆 改为清晰区分功能的命名
Hermes 3 Llama 3.1 405BapiBase 缺少必要字段,且 405B 本地无法运行 已移除该无效配置
Autodetect 使用 Ollama 你并未部署 Ollama,该配置无效 已移除

📝 关于 useLegacyCompletionsEndpoint

useLegacyCompletionsEndpoint: false 表示使用 OpenAI 兼容的 /v1/chat/completions 接口(推荐)。如果设为 true,则会使用旧版的 /v1/completions 接口(仅适用于非对话模型)。

⚠️ 使用前请确认

  1. 你的 llama-server 已正常启动,且 apiBase 地址 http://172.17.10.167:8080/v1 可访问。
  2. 在浏览器访问 http://172.17.10.167:8080/v1/models,确认能返回模型列表。
  3. contextLength 建议从 8192 开始,如果运行稳定再逐步增加。

保存配置后,重启 VSCode 即可生效。


本地模型,不需要注册cline账号

不需要。使用本地模型(如你通过 llama.cpp 部署的模型)时,完全不需要注册或登录 Cline 账号

🔑 Cline 的两种使用方式

Cline 支持两种模式,你可以根据需求选择:

  1. Cline 账号模式(需要注册):通过注册账号使用 Cline 提供的云模型额度,或管理自己的 API 密钥。该模式适合不想自己管理 API 密钥的用户。

  2. 自带密钥/本地模型模式(无需注册):即 BYOK(Bring Your Own Key) 模式。使用自己的云端模型 API 密钥,或配置本地模型(如 Ollama/LM Studio)。使用本地模型时,不需要任何 API 密钥,只需确保本地模型服务(如 llama.cpp)正在运行即可。该模式适合注重隐私、希望完全离线使用或避免按量付费的用户。

⚙️ 如何配置本地模型(无需账号)

  1. 在 VSCode 中点击 Cline 图标,打开其面板。
  2. 点击面板右上角的设置(⚙️)图标
  3. API Provider 下拉菜单中,选择 OpenAI Compatible
  4. API Key 字段中,可以留空或填写任意占位符(如 not-needed),因为本地服务不验证密钥。
  5. Base URL 字段中,填写你 llama.cpp 服务的地址,例如 http://172.17.10.167:8080/v1
  6. Model ID 字段中,填入你希望使用的模型名称(如 qwen3.8)。

完成以上配置后,Cline 就会直接与你的本地 llama.cpp 服务通信,整个过程完全不需要注册或登录任何账号。


Cline调用本地模型时的上下文长度超限错误问题解决

报错问题:

CLINE返回如下信息:
[openai] 400400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it

{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}

(Click "Retry" below)

{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}

Auto-Retry Failed

Auto-retry failed after __3__ attempts. Manual intervention required.

这个错误很明确:你的请求(11745 tokens)超过了模型当前允许的上下文长度(8192 tokens)

🔍 原因分析

Cline 在发送请求时,会把以下内容全部计入上下文(n_prompt_tokens):

  • 系统提示词(System Prompt)
  • 对话历史(多轮对话累积)
  • 当前消息
  • 工具定义(Tool Definitions)
  • 文件内容等

当这些内容加起来超过你设置的 contextLength: 8192 时,就会报错。

🛠️ 解决方案(按推荐顺序)

方案一:增大 Cline 设置中的上下文长度(推荐)

在 Cline 的设置中,将 Context Window Size 调大。

  1. 点击 Cline 面板右上角的 设置(⚙️)图标

  2. 找到 Context Window Size 选项。

  3. 将数值从 8192 修改为 3276865536

    注意:这个值需要与你的 llama-server 启动时指定的 -c 参数匹配。如果你的 llama-server 启动命令中没有指定 -c,默认值可能较小,需要加上 -c 32768 重启服务。

  4. 保存后,点击 "Retry" 重试。

方案二:检查你的 llama-server 启动参数

即使你在 Cline 中设置了 32768,如果 llama-server 本身的上下文限制低于这个值,仍然会报错。

  • 检查启动命令中是否包含 -c--ctx-size 参数。
  • 如果没有,重启 llama-server,并加上参数:
    ./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -c 32768
    
  • 确保 -c 的值 ≥ Cline 中设置的 Context Window Size

方案三:减少当前对话的上下文(临时缓解)

如果暂时不想改配置,可以做以下任一操作:

  • 点击 Cline 面板右上角的 “+”“New Task”开启一个新对话(对话历史会被清空,当前请求的 tokens 会大幅减少)。
  • 检查当前对话中有没有打开过特别大的文件,如果有,先关闭或精简提示词。

💎 建议设置

配置位置 推荐值 说明
Cline 设置 Context Window Size: 32768 27B 模型支持 32K 上下文较稳妥
llama-server -c 32768-c 65536 必须 ≥ Cline 中的设置值

⚠️ 注意:上下文越大,显存/内存占用也越大,推理速度会变慢。如果设置 32768 后出现 OOM(内存不足),请逐步降低到 1638424576 试试。

posted @ 2026-08-21 15:29  念槐聚  阅读(46)  评论(0)    收藏  举报