共计 1142 个字符,预计需要花费 3 分钟才能阅读完成。
背景与痛点
最近尝试用 ChatGPT API 构建客服机器人时,发现新手常会遇到这些问题:

- 上下文丢失 :多轮对话后 AI 忘记之前的交流内容
- 响应不稳定 :相同问题有时得到不同答案
- token 消耗快 :长对话场景成本难以控制
- 速率限制 :突发流量导致请求被拒绝
- 敏感内容失控 :用户输入可能触发不当回复
技术方案对比
方案 1:直接调用 API
优点:
- 实现简单,只需发送 HTTP 请求
- 响应速度快,没有中间层延迟
缺点:
- 需要自行处理上下文拼接
- 缺乏请求缓冲机制
方案 2:使用中间件(如 LangChain)
优点:
- 内置对话历史管理
- 支持插件扩展
缺点:
- 学习曲线较陡
- 额外依赖可能引入兼容性问题
核心实现
基础对话示例
import openai
# 初始化客户端
openai.api_key = 'your-api-key'
def chat(prompt, history=[]):
messages = [{"role": "system", "content": "你是个乐于助人的 AI 助手"},
*history,
{"role": "user", "content": prompt}
]
response = openai.ChatCompletion.create(
model="gpt-3.5-turbo",
messages=messages,
temperature=0.7 # 控制创造性
)
return response.choices[0].message.content
上下文管理技巧
- 维护对话历史队列
- 设置最大 token 限制
- 重要信息摘要存储
性能优化
延迟优化方案
- 启用流式响应(stream=True)
- 本地缓存高频问题答案
- 使用轻量级模型(如 gpt-3.5-turbo)
Token 节省策略
# 自动修剪过长的对话历史
def trim_history(history, max_tokens=2000):
total = sum(len(msg["content"]) for msg in history)
while total > max_tokens and len(history) > 1:
removed = history.pop(1) # 保留系统消息
total -= len(removed["content"])
return history
避坑指南
- 速率限制 :实现指数退避重试机制
- 敏感内容 :前置过滤用户输入
- 超时处理 :设置合理的 API 等待时间
- 错误日志 :记录完整请求 / 响应
- 测试覆盖 :模拟极端对话场景
进阶建议
根据吴恩达课程中的 NLP 最佳实践:
- 使用 few-shot learning 提供示例
- 设计清晰的系统提示词
- 对输出结果进行后处理
实践任务
尝试实现以下功能:
- 持久化存储对话历史到数据库
- 添加情感分析模块
- 实现自动超时切换备用模型
完整项目示例可参考 GitHub 仓库(需替换为真实链接)。在实际开发中,建议从小功能开始迭代,逐步完善系统能力。
正文完
发表至: 未分类
近三天内
