自托管大模型 + Agent 的完整方案
一、完整方案要解决什么 「自托管大模型 + Agent」不是单点安装,而是一条可运维链路:模型推理 → 统一 API → Agent 运行时 → 工具与知识库 → 观测与权限。目标是:数据尽量不出域,成本可控,能力可扩展。 二、参考架构 用户 / 内部系统 │ ▼ OpenWebUI(可选,人工对话与评测) │ ▼ A...
大模型 API 网关设计:限流 / 熔断 / 缓存
一、为什么大模型调用需要网关 业务侧直接连 OpenAI / 国产大模型 / 自建 Ollama,短期省事,长期会踩三类坑:账单失控(突发流量打满配额)、稳定性差(上游抖动直接传导到用户)、重复成本高(相同 Prompt 反复计费)。一层大模型 API 网关可以把鉴权、路由、限流、熔断、缓存和观测收敛到统一入口,让 A...
Docker 部署 Ollama + OpenWebUI 完整指南
一、为什么选 Ollama + OpenWebUI Ollama 负责在本机或服务器上拉起与管理大模型(拉取、运行、OpenAI 兼容 API);OpenWebUI(原 Ollama WebUI)提供类 ChatGPT 的对话界面、多会话、知识库与工具扩展。二者用 Docker 组合后,可以快速搭一套私有、可自托管的本...