Continue插件配置
本地模型是 llama.cpp + models Qwen3.8-27B-UD-Q4_K_M.gguf + mmproj-F16.gguf 方式部署启动的,如何向Cline、Continue中配置
你的 llama.cpp 部署方式,可以通过配置让 Cline 和 Continue 使用本地模型。关键在于 llama.cpp 提供了与 OpenAI 兼容的 API 接口,所以两个插件都可以通过 OpenAI Compatible 方式接入。
⚙️ 启动 llama.cpp 服务器
在配置插件前,需要先启动 llama-server。一个基础的启动命令如下:
./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080
-m:指定你的模型文件路径。--port 8080:指定服务端口,后续配置需要用到。
注意:如果模型支持
--jinja模板,或需要加载mmproj文件(用于多模态),请根据实际情况添加相应参数。
🧩 配置 Cline
Cline 没有内置的 llama.cpp 选项,需要选择 OpenAI Compatible 来接入。
步骤:
- 在 VSCode 中点击 Cline 图标,进入设置(齿轮图标)。
- API Provider 下拉菜单选择
OpenAI Compatible。 - 填写以下信息:
- Base URL:
http://localhost:8080/v1(务必加上/v1)。 - API Key:输入任意字符串,如
not-needed(本地服务不验证)。 - Model ID:
Qwen3.8-27B-UD-Q4_K_M(或任意能帮助你识别的名称)。
- Base URL:
保存后即可使用。
🧩 配置 Continue
Continue 支持两种配置方式,推荐使用更灵活的 YAML 配置文件。
方法一:使用 YAML 配置文件(推荐)
在项目根目录下创建 .continue/models/ 文件夹,并新建一个 llama.yaml 文件。填入以下内容:
name: Local Llama.cpp
version: 1.0.0
schema: v1
models:
- name: Qwen3.8-27B
provider: llama.cpp
model: Qwen3.8-27B-UD-Q4_K_M.gguf
apiBase: http://localhost:8080
roles:
- chat
- edit
- autocomplete # 如果需要代码补全功能
defaultCompletionOptions:
contextLength: 8192
保存后,Continue 会自动识别配置。
方法二:通过 VSCode 设置
- 打开 VSCode 设置(
Ctrl+,),搜索continue。 - 找到
Continue: Config设置,点击Edit in settings.json。 - 在配置文件中添加类似如下的条目:
{ "continue.models": [ { "title": "Qwen3.8-27B (Local)", "provider": "llama.cpp", "model": "Qwen3.8-27B-UD-Q4_K_M.gguf", "apiBase": "http://localhost:8080" } ] }
⚠️ 重要注意事项
- 工具调用(Tool Calls)限制:
llama.cpp的工具调用支持可能不完善,复杂任务(如自动创建文件)可能不如云端模型稳定。 - 代码补全优化:如果要用作代码补全模型,可在配置中加上
roles: [autocomplete]角色,并设置autocompleteOptions参数优化体验。 - 模型性能:27B 模型较大,在 CPU 上运行可能较慢,请合理设置上下文长度 (
contextLength)。 - 端口与地址:确保
apiBase的端口与llama-server启动时指定的--port一致。
如果遇到连接问题,可以先在浏览器中访问 http://localhost:8080/v1/models,看是否能返回模型列表,以此确认服务是否正常运行。
Continue的配置参考
这份配置存在多处错误,主要是 useLegacyCompletionsEndpoint 字段位置错误,以及部分模型参数定义不规范。我帮你重写了一份修正版:
name: Main Config
version: 1.0.0
schema: v1
models:
# =====================================================
# 主模型:Qwen3.8-27B(聊天+编辑+应用)
# =====================================================
- name: Qwen3.8-27B (Local)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- chat
- edit
- apply
defaultCompletionOptions:
contextLength: 8192 # 27B模型建议先设8192,稳定后可逐步调大
maxTokens: 4096 # 单次最大生成长度
temperature: 0.7
topP: 0.95
useLegacyCompletionsEndpoint: false
# =====================================================
# 长上下文模型(仅聊天,用于文档分析)
# =====================================================
- name: Qwen3.8-27B (Long Context)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- chat
defaultCompletionOptions:
contextLength: 32768 # 长上下文,量力而行
maxTokens: 4096
temperature: 0.5
useLegacyCompletionsEndpoint: false
# =====================================================
# 快速响应模型(轻量编辑任务)
# =====================================================
- name: Qwen3.8-27B (Fast)
provider: llama.cpp
model: qwen3.8
apiKey: sk-qwen-local-2026
apiBase: http://172.17.10.167:8080/v1
roles:
- edit
- apply
defaultCompletionOptions:
contextLength: 4096
maxTokens: 2048
temperature: 0.3
useLegacyCompletionsEndpoint: false
🔧 主要修正说明
| 错误点 | 原因 | 修复方案 |
|---|---|---|
useLegacyCompletionsEndpoint 位置错误 |
该字段属于模型级配置,不能放在 defaultCompletionOptions 内部 |
提升到与 provider、model 同级 |
contextLength: 1047576 过大 |
llama.cpp 本地服务支持不了百万级上下文 | 27B 模型建议先设 8192,根据实际显存/内存情况逐步调大 |
maxTokens: 32768/100000 过大 |
单次生成超长输出容易超时或 OOM | 建议设为 4096 以内 |
capabilities: [image_input] 无效 |
llama.cpp + Qwen3.8 不支持多模态 | 已移除该字段 |
| 模型命名混淆 | 三个模型都叫 OpenAI GPT-4.1 容易混淆 |
改为清晰区分功能的命名 |
Hermes 3 Llama 3.1 405B 无 apiBase |
缺少必要字段,且 405B 本地无法运行 | 已移除该无效配置 |
Autodetect 使用 Ollama |
你并未部署 Ollama,该配置无效 | 已移除 |
📝 关于 useLegacyCompletionsEndpoint
useLegacyCompletionsEndpoint: false 表示使用 OpenAI 兼容的 /v1/chat/completions 接口(推荐)。如果设为 true,则会使用旧版的 /v1/completions 接口(仅适用于非对话模型)。
⚠️ 使用前请确认
- 你的 llama-server 已正常启动,且
apiBase地址http://172.17.10.167:8080/v1可访问。 - 在浏览器访问
http://172.17.10.167:8080/v1/models,确认能返回模型列表。 contextLength建议从 8192 开始,如果运行稳定再逐步增加。
保存配置后,重启 VSCode 即可生效。
本地模型,不需要注册cline账号
不需要。使用本地模型(如你通过 llama.cpp 部署的模型)时,完全不需要注册或登录 Cline 账号。
🔑 Cline 的两种使用方式
Cline 支持两种模式,你可以根据需求选择:
-
Cline 账号模式(需要注册):通过注册账号使用 Cline 提供的云模型额度,或管理自己的 API 密钥。该模式适合不想自己管理 API 密钥的用户。
-
自带密钥/本地模型模式(无需注册):即 BYOK(Bring Your Own Key) 模式。使用自己的云端模型 API 密钥,或配置本地模型(如 Ollama/LM Studio)。使用本地模型时,不需要任何 API 密钥,只需确保本地模型服务(如
llama.cpp)正在运行即可。该模式适合注重隐私、希望完全离线使用或避免按量付费的用户。
⚙️ 如何配置本地模型(无需账号)
- 在 VSCode 中点击 Cline 图标,打开其面板。
- 点击面板右上角的设置(⚙️)图标。
- 在 API Provider 下拉菜单中,选择
OpenAI Compatible。 - 在 API Key 字段中,可以留空或填写任意占位符(如
not-needed),因为本地服务不验证密钥。 - 在 Base URL 字段中,填写你
llama.cpp服务的地址,例如http://172.17.10.167:8080/v1。 - 在 Model ID 字段中,填入你希望使用的模型名称(如
qwen3.8)。
完成以上配置后,Cline 就会直接与你的本地 llama.cpp 服务通信,整个过程完全不需要注册或登录任何账号。
Cline调用本地模型时的上下文长度超限错误问题解决
报错问题:
CLINE返回如下信息:
[openai] 400400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it
{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}
(Click "Retry" below)
{"message":"400 request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","status":400,"code":400,"modelId":"qwen3.8","providerId":"openai","details":{"code":400,"message":"request (11745 tokens) exceeds the available context size (8192 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":11745,"n_ctx":8192}}
Auto-Retry Failed
Auto-retry failed after __3__ attempts. Manual intervention required.
这个错误很明确:你的请求(11745 tokens)超过了模型当前允许的上下文长度(8192 tokens)。
🔍 原因分析
Cline 在发送请求时,会把以下内容全部计入上下文(n_prompt_tokens):
- 系统提示词(System Prompt)
- 对话历史(多轮对话累积)
- 当前消息
- 工具定义(Tool Definitions)
- 文件内容等
当这些内容加起来超过你设置的 contextLength: 8192 时,就会报错。
🛠️ 解决方案(按推荐顺序)
方案一:增大 Cline 设置中的上下文长度(推荐)
在 Cline 的设置中,将 Context Window Size 调大。
-
点击 Cline 面板右上角的 设置(⚙️)图标。
-
找到
Context Window Size选项。 -
将数值从
8192修改为32768或65536。注意:这个值需要与你的
llama-server启动时指定的-c参数匹配。如果你的llama-server启动命令中没有指定-c,默认值可能较小,需要加上-c 32768重启服务。 -
保存后,点击 "Retry" 重试。
方案二:检查你的 llama-server 启动参数
即使你在 Cline 中设置了 32768,如果 llama-server 本身的上下文限制低于这个值,仍然会报错。
- 检查启动命令中是否包含
-c或--ctx-size参数。 - 如果没有,重启
llama-server,并加上参数:./llama-server -m /path/to/Qwen3.8-27B-UD-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -c 32768 - 确保
-c的值 ≥ Cline 中设置的Context Window Size。
方案三:减少当前对话的上下文(临时缓解)
如果暂时不想改配置,可以做以下任一操作:
- 点击 Cline 面板右上角的 “+” 或 “New Task”,开启一个新对话(对话历史会被清空,当前请求的 tokens 会大幅减少)。
- 检查当前对话中有没有打开过特别大的文件,如果有,先关闭或精简提示词。
💎 建议设置
| 配置位置 | 推荐值 | 说明 |
|---|---|---|
| Cline 设置 | Context Window Size: 32768 |
27B 模型支持 32K 上下文较稳妥 |
| llama-server | -c 32768 或 -c 65536 |
必须 ≥ Cline 中的设置值 |
⚠️ 注意:上下文越大,显存/内存占用也越大,推理速度会变慢。如果设置 32768 后出现 OOM(内存不足),请逐步降低到
16384或24576试试。
赠人玫瑰
手留余香
我们曾如此渴望命运的波澜,到最后才发现:人生最曼妙的风景,竟是内心的淡定与从容……我们曾如此期盼外界的认可,到最后才知道:世界是自己的,与他人毫无关系!-杨绛先生
如果,您希望更容易地发现我的新博客,不妨点击一下绿色通道的【关注我】。

浙公网安备 33010602011771号