给 Agent 接工具前,我会先限制什么
Agent 的风险不在于它会不会思考,而在于它能调用什么。工具白名单、参数校验、预算、幂等和人工确认要先于模型能力。
技术文章、项目复盘和工程笔记,按发布时间整理。
Agent 的风险不在于它会不会思考,而在于它能调用什么。工具白名单、参数校验、预算、幂等和人工确认要先于模型能力。
流畅回答不等于可靠回答。把检索、引用、置信度和拒答拆开,才能判断问题出在资料、召回还是模型生成。
把 AI 放进需求澄清、实现、验证和评审之间。代码生成只是中间步骤,验收闭环才决定结果能不能交付。
把回答、会话、引用、检索 trace 和模型调用记录拆开保存,才能回答结果从哪里来、为什么会这样,以及如何复现。
企业知识库 RAG 的效果,很大一部分在文档入库阶段就决定了。本文整理文档入库流程怎么设计:文件接收、hash 去重、解析、清洗、切片、元数据、embedding、索引状态、失败重试和回滚。
企业知识库 RAG 不是接一个聊天框,而是把文档入库、检索、重排、引用、权限、trace 和评测串成闭环。本文作为专题入口,先讲总体设计、架构分层、技术选型和实施顺序。
我把 Hermes Agent 和 OpenClaw 同时装在本地,用日常最高频的工作流(code review、调试、研究笔记、浏览器验证)跑了两个月。这篇把两者放在一起,直接对比实现原理、架构、优劣势,并结合正在使用的 Superpowers 说说实际取舍。
Skill 不是提示词合集,也不是单个工具调用,而是一套可复用的工作流说明。本文整理 Skill 的定义、和 Prompt / MCP / Agent 的区别,并结合 Superpowers 这类开发流程 Skill Pack、Claude Code、Codex 等开发者工作流整理开发中常用的主流 Skill 类型。
AI 编程没有万能打法。我主要按新项目和旧项目维护拆成两套流程,核心是主动写 SPEC 定边界、拆小任务、每步验证、并用 HANDOFF 保持连续性。这些文档不是一次性拉满,而是从新项目逐步积累起来的。这篇是我半年真实迭代后的做法。
不把大模型当聊天框。以知识库问答和运维诊断为例,拆开接口调用、提示词组成、结构化结果、会话保存和可审计记录。