从零搭建一个能调用工具的 AI Agent
一、目标:做一个「会用工具」的最小 Agent 本文不堆框架名词,只带你完成一条最小闭环:用户提出问题 → 模型决定是否调用工具 → 执行工具 → 模型基于结果回答。会用工具,才算 Agent;否则只是聊天套壳。 二、你需要准备什么 一个支持 tool / function calling 的模型(云 API 或自托管...
自托管大模型 + Agent 的完整方案
一、完整方案要解决什么 「自托管大模型 + Agent」不是单点安装,而是一条可运维链路:模型推理 → 统一 API → Agent 运行时 → 工具与知识库 → 观测与权限。目标是:数据尽量不出域,成本可控,能力可扩展。 二、参考架构 用户 / 内部系统 │ ▼ OpenWebUI(可选,人工对话与评测) │ ▼ A...
Hermes Agent 部署踩坑全记录
一、这篇写给「按文档做了但就是起不来」的人 Hermes Agent(社区亦常被搜成 Hermas)走自托管路线时,坑主要集中在:环境变量、模型接口兼容、工具权限、Docker 网络、以及「看起来启动成功但第一条工具调用就失败」。本文按真实排障顺序记录,方便对照。 二、环境与依赖类 现象:安装成功,启动即报模块缺失 /...
RAG 系统从 0 到 1:向量数据库选型
一、RAG 不是「接个向量库就完事」 RAG(检索增强生成)的目标,是让模型在回答前先拿到可引用的私有知识。向量数据库只是检索层的一种实现;从 0 到 1,你还要定:文档切分、嵌入模型、召回策略、重排、引用格式与更新流水线。本文聚焦最容易卡住的决策:向量数据库怎么选。 二、先分清你的数据规模与约束 个人/小团队 PoC...
Agent 生产环境稳定性:超时、重试、降级
一、Agent 不稳,往往不是模型「变笨了」 线上最常见的体验是:偶尔超时、工具偶发失败、重试把账单打爆、降级策略缺失导致整条链路挂死。Agent 比普通 API 更脆,因为它是多步循环:模型 → 工具 → 模型 → 工具……任何一环抖动都会被放大。 二、超时:分层设,而不是只设一个全局 60 秒 模型调用超时:按模型...
大模型 API 网关设计:限流 / 熔断 / 缓存
一、为什么大模型调用需要网关 业务侧直接连 OpenAI / 国产大模型 / 自建 Ollama,短期省事,长期会踩三类坑:账单失控(突发流量打满配额)、稳定性差(上游抖动直接传导到用户)、重复成本高(相同 Prompt 反复计费)。一层大模型 API 网关可以把鉴权、路由、限流、熔断、缓存和观测收敛到统一入口,让 A...
Docker 部署 Ollama + OpenWebUI 完整指南
一、为什么选 Ollama + OpenWebUI Ollama 负责在本机或服务器上拉起与管理大模型(拉取、运行、OpenAI 兼容 API);OpenWebUI(原 Ollama WebUI)提供类 ChatGPT 的对话界面、多会话、知识库与工具扩展。二者用 Docker 组合后,可以快速搭一套私有、可自托管的本...