工程实践

RAG 系统从 0 到 1:向量数据库选型

一、RAG 不是「接个向量库就完事」 RAG(检索增强生成)的目标,是让模型在回答前先拿到可引用的私有知识。向量数据库只是检索层的一种实现;从 0 到 1,你还要定:文档切分、嵌入模型、召回策略、重排、引用格式与更新流水线。本文聚焦最容易卡住的决策:向量数据库怎么选。 二、先分清你的数据规模与约束 个人/小团队 PoC...

Agent 生产环境稳定性:超时、重试、降级

一、Agent 不稳,往往不是模型「变笨了」 线上最常见的体验是:偶尔超时、工具偶发失败、重试把账单打爆、降级策略缺失导致整条链路挂死。Agent 比普通 API 更脆,因为它是多步循环:模型 → 工具 → 模型 → 工具……任何一环抖动都会被放大。 二、超时:分层设,而不是只设一个全局 60 秒 模型调用超时:按模型...

大模型 API 网关设计:限流 / 熔断 / 缓存

一、为什么大模型调用需要网关 业务侧直接连 OpenAI / 国产大模型 / 自建 Ollama,短期省事,长期会踩三类坑:账单失控(突发流量打满配额)、稳定性差(上游抖动直接传导到用户)、重复成本高(相同 Prompt 反复计费)。一层大模型 API 网关可以把鉴权、路由、限流、熔断、缓存和观测收敛到统一入口,让 A...

← 返回标签列表