共计 1508 个字符,预计需要花费 4 分钟才能阅读完成。
环境准备:Ollama 与 DeepSeek-7B 部署
-
Ollama 服务安装
官方推荐使用管理员权限运行 PowerShell 执行:winget install Ollama.Ollama安装后需手动启动服务:
Start-Service ollama
-
代理配置(如遇下载失败):
$env:HTTP_PROXY="http://127.0.0.1:7890" $env:HTTPS_PROXY="http://127.0.0.1:7890" -
模型下载与验证
下载 DeepSeek-7B 模型(约 13GB):ollama pull deepseek-ai/deepseek-llm:7b验证模型加载:
ollama run deepseek-ai/deepseek-llm:7b "你好"正常应返回中文响应,若出现 CUDA 错误需检查显卡驱动版本。
核心配置:Claude Code 参数解析
配置文件通常位于 %APPDATA%\ClaudeCode\config.json,关键字段说明:
{
"hascompletedonboarding": true, // 跳过首次引导,直接启用高级功能
"model_endpoint": "http://localhost:11434", // Ollama 默认端口
"max_tokens": 2048, // 限制单次请求 token 数量
"stream": true // 启用 SSE 流式响应
}
- 重点参数:
hascompletedonboarding实际控制是否显示新手引导界面,设为 true 可避免初次使用时多余的配置步骤。
VSCode 集成实战
-
插件安装
在 VSCode 扩展市场搜索 ”ClaudeCode” 安装,注意认准官方出品标识。 -
端点配置
按Ctrl+,打开设置,搜索 ”ClaudeCode” 填写: - Model Endpoint:
http://localhost:11434 -
Default Model:
deepseek-ai/deepseek-llm:7b -
流式响应测试
新建空白文件,输入问题后按Ctrl+Enter,观察右下角逐步输出的回答。
验证方案:Python 测试脚本
import aiohttp
import asyncio
async def test_model():
async with aiohttp.ClientSession() as session:
payload = {
"model": "deepseek-ai/deepseek-llm:7b",
"prompt": "解释量子纠缠现象",
"stream": False
}
async with session.post(
"http://localhost:11434/api/generate",
json=payload
) as resp:
print(await resp.json())
asyncio.run(test_model())
正常响应应包含 "response":"..." 字段,若超时需检查防火墙设置。
避坑指南
-
路径问题
Windows 路径需转义反斜杠:C:\\Users\\name\\AppData -
防火墙配置
允许 Ollama 入站规则:New-NetFirewallRule -DisplayName "Ollama" -Direction Inbound -Action Allow -Protocol TCP -LocalPort 11434 -
CUDA 版本冲突
使用nvidia-smi确认驱动版本,需 CUDA 11.7+ 支持。
延伸建议
- 性能优化:在 config.json 中调整
num_gpu_layers参数提升推理速度 - 多模型切换:通过修改
default_model字段快速切换不同模型 - 高级调试:使用 Wireshark 抓包分析 SSE 流数据格式
正文完

