Topic Atlas
博客专题导航
按六个常见目标进入专题:建设 Agent、补 RAG、做 MCP/Skills、做评测治理、准备面试、查看产品界面。每个入口都连接到项目、工程笔记和面试材料。
先选一个主题枢纽
Agent Builder Hub
把 PRD、RAG、MCP、Skill、Eval、Release Gate 和作品集表达串成一条建设路线。
进入建设路线 →RAG知识与检索工程
入库、metadata、权限、引用、freshness、query router、检索评测和企业知识治理。
查看 RAG 路线 →MCP / SkillsAgent 扩展能力
区分 Tool、MCP Server、Skill、Plugin、Hook 的边界,并沉淀可复用工具能力。
查看扩展策略 →Eval / Ops评测、可观测与上线门禁
用 scorecard、trace replay、失败聚类、dashboard 和 release gate 管住 Agent 质量。
查看上线门禁 →Security安全治理与企业落地
Prompt Injection、PII、RBAC、审计、Secret、Guardrails、红队和合规表达。
查看安全路线 →Career求职作品集证据
把项目、代码、文章、Demo、评测和面试故事映射到简历关键词与岗位要求。
查看证据地图 →快速阅读路线
做一个可展示 Agent Demo
把一个 Agent 做成作品集
把散知识转成回答体系
查看 Agent 控制台与证据面板
按目标选阅读路径
按主题浏览全部专题
六个枢纽分组收录全站全部专题:每组先看核心小表,展开可浏览该组其余专题。
RAG 与知识工程
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| RAG 工程化:从文档到可评估答案 | 从文档解析、Chunk、Embedding、检索、Rerank、引用和评测理解生产级 RAG。 | 想做 RAG 项目、理解 RAG 工程全链路的人 |
| RAG 入库流水线:从原始文件到可检索知识库 | 设计文件校验、解析、Normalize、Chunk、Metadata、Embedding、索引、质量检查和文档生命周期。 | 想把知识库入库做稳定的人 |
| RAG Query Router | 按问题意图选择 FAQ、政策检索、多跳、SQL、拒答或工具调用链路,降低成本并提升召回质量。 | 想把 RAG 从单一路径升级成可控路由的人 |
| RAG 检索故障排查 | 按文档、Chunk、Query Rewrite、召回、Filter、Rerank、Context Pack、生成逐层定位答案差原因。 | 想系统排查 RAG 效果问题的人 |
| RAG Citation Evaluation | 评测 citation coverage、faithfulness、permission、freshness 和 no-answer,让引用成为证据链。 | 想把 RAG 答案可信度做扎实的人 |
| RAG Grounding Contract | 将 claim-to-citation、no-answer、权限、freshness 和输出结构变成可信契约。 | 想让 RAG 答案更可信的人 |
| RAG 评测报告模板 | 把数据集、指标、Pipeline 配置、失败归因、成本延迟和安全结果写成可复现报告。 | 想把 RAG 优化讲成工程闭环的人 |
| RAG 知识生命周期 | 管理文档版本、发布、过期、权限变化、增量重建、缓存失效和质量门禁。 | 想避免 RAG 返回旧答案和冲突答案的人 |
| RAG Freshness Evaluation | 评估新文档、更新、过期、删除、权限变化和缓存失效后的知识新鲜度。 | 想避免 RAG 使用过期知识的人 |
| 多模态文档理解 Agent | 处理 PDF、图片、表格、版面块、OCR 和结构化抽取,把复杂文档变成可检索证据。 | 想做文档智能和多模态项目的人 |
更多 RAG 与知识工程专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| 向量检索选型:Embedding、Hybrid Search、Rerank 和 Metadata Filter | 从 Dense/Sparse、混合检索、权限过滤、重排和评测设计完整检索链路。 | 想提升 RAG 召回质量的人 |
| Embedding 模型评测与迁移 | 用 Recall@k、MRR、hard negative、shadow query 和 canary 安全迁移向量模型。 | 想替换 embedding 模型但避免召回退化的人 |
| GraphRAG 工程化:当普通向量检索不够用 | 用实体、关系、子图、社区摘要和证据回溯补足普通 RAG 的多跳关系能力。 | 想做复杂知识关系检索的人 |
| 企业知识库权限与多租户 RAG | 把 tenant、ACL、metadata filter、缓存失效和 GraphRAG 权限隔离纳入检索链路。 | 想做企业级知识库的人 |
| RAG 权限过滤 | 在检索、rerank、context pack、citation 和缓存层控制 tenant、ACL、状态和生效期。 | 想避免企业知识库越权泄漏的人 |
| RAG vs Fine-tuning | 判断什么时候该做检索增强,什么时候该做行为/格式微调,以及两者如何组合。 | 准备大模型工程取舍题的人 |
Agent Runtime 与编排
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Agent Runtime 是什么:Agent 真正开始工作的执行引擎 | 理解 Agent 的任务执行引擎,包括模型调用、工具调度、状态推进和结果生成。 | 想理解 Agent 任务执行引擎的人 |
| Agent 开发 Playbook:从需求到可上线版本 | 从业务问题、单 Agent 闭环、工具/RAG、State、Trace、Evaluation、Guardrails 到多 Agent 的开发顺序。 | 想把 Agent 从想法推进到可验证项目的人 |
| Agent 编排模式:Router、Planner、Supervisor 和 Workflow 怎么选 | 对比 Chain、Router、Planner-Executor、Supervisor、State Machine、Graph Workflow 和人审模式。 | 想设计可控 Agent Runtime 的人 |
| Agent 框架选型:LangGraph、OpenAI Agents SDK、LlamaIndex、CrewAI 怎么看 | 从任务边界、State、Tool、Human-in-the-loop、Trace、RAG 和团队维护成本选择框架。 | 想讲清楚框架取舍的人 |
| Agent Workflow 状态机设计 | 把 Created、Queued、Planning、RunningTool、WaitingApproval、Completed、Failed 建模成可恢复执行轨道。 | 想让 Agent 长任务可控、可恢复、可解释的人 |
| Agent Autonomy Levels | 将 Agent 自主能力拆成建议、草稿、低风险执行、审批执行、委托自主和高风险自主等级。 | 想把 Agent 自主性讲清楚的人 |
| Agent 失败恢复与幂等设计 | 设计状态机、幂等键、重试分类、断点续跑、补偿和人工介入,让长任务失败后能继续。 | 想做可靠长任务 Agent 的人 |
| Memory 与 State:Agent 不只是记住聊天记录 | 区分 Session、Context、Memory、State 和 Trace,理解长任务和多 Agent 的状态管理。 | 想理解 Agent 记忆与状态管理的人 |
| Agent Queue 与 Backpressure | 设计优先级队列、并发控制、背压、熔断、死信队列和长任务用户体验。 | 想让 Agent 长任务不压垮系统的人 |
| Agent 数据库设计:状态、证据与执行记录 | 用 Task、Run、Step、Tool Call、Document、Chunk、Trace、Evaluation 建模 Agent 系统数据。 | 想理解 Agent 数据建模的学习者 |
| FastAPI 到 Agent Backend:接口层怎么设计 | 从路由、Schema、Service、Worker、Trace、Evaluation 和权限理解 Agent 后端接口层。 | 想把 Agent / RAG 做成后端服务的学习者 |
| OpenClaw 架构拆解:复杂 Agent 系统怎么分层 | 理解 Gateway、Channel、Session、Runtime、Workspace、Memory、Tools、Security 和 Evaluation。 | 想学习复杂 Agent 系统架构拆分的人 |
更多 Agent Runtime 与编排专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| LLM Gateway | 统一治理多模型调用、路由、限流、成本、Prompt 版本、降级和审计。 | 想把模型调用接入生产后端的人 |
| Structured Output 工程化 | 用 Schema、类型校验、重试修复、Trace 和评测让模型输出稳定进入业务系统。 | 想把 LLM 输出接入前后端和工作流的人 |
| Multi-Agent Handoff Protocol | 用 handoff payload、evidence_refs、constraints 和 acceptance_criteria 治理多 Agent 交接。 | 想让多 Agent 协作可控的人 |
| Agent Scheduler 与 Cron | 设计定时、延迟、周期和事件触发 Agent 的幂等、并发、预算、Trace 和熔断。 | 想做定时巡检、日报、批量评测和自动运营 Agent 的人 |
| Agent 错误分类 | 把 input、policy、context、retrieval、model、tool、runtime、infra、ux error 分开处理。 | 想系统排查 Agent 失败的人 |
| Context Engineering | 理解系统规则、任务上下文、RAG 证据、Memory、State、Trace 如何分层进入模型上下文。 | 想提升长任务 Agent 稳定性的人 |
| Context Window 管理 | 从 token 预算、历史压缩、证据排序、Memory 过滤和上下文 Trace 设计长上下文。 | 准备上下文工程深挖的人 |
| 长期记忆系统设计 | 设计用户偏好、项目事实、记忆候选、证据校验、检索和遗忘机制。 | 想构建长期个性化 Agent 的人 |
| Realtime Voice Agent | 理解低延迟语音输入输出、打断处理、多轮状态、工具调用和语音安全边界。 | 想做实时语音 Agent 的人 |
| Browser / Computer Use Agent | 理解让 Agent 操作 GUI、浏览器、截图、DOM 和高风险动作审批的工程边界。 | 想做浏览器/电脑控制 Agent 的人 |
| 数据分析 Agent:从自然语言到 SQL、图表和洞察 | 设计语义层、SQL 校验、权限过滤、图表推荐、洞察生成和分析 Trace。 | 想做数据智能分析项目的人 |
| Agent UI State Machine | 把任务提交、规划、工具调用、审批、失败重试和完成建模成前端可渲染的状态机。 | 想让 Agent 前端状态可控的人 |
| 从 RAG 到生产级 Agent Harness 的工程化学习路线 | 建立从 RAG、Tool Calling、Memory、Trace、Evaluation 到 Deploy 的工程路线。 | 想建立 AI Agent 工程学习地图的人 |
| Hermes Agent 高级用法与进阶玩法 | 理解子代理驱动开发、Kanban、多代理协作、TDD、MCP、Cron、Skills 和安全控制。 | 想理解 Agent Harness 高级能力的人 |
| Hook 机制为什么是 Agent Harness 最重要的资产 | 理解 Agent Harness 如何通过规则、工具边界和治理层变得可控。 | 想把 Agent 从 Prompt Demo 推向可控系统的人 |
| Hermes vs OpenClaw:Agent 架构差异怎么理解 | 横向比较 Hermes 与 OpenClaw 在系统定位、任务组织、Runtime、Tool、Workspace、Memory、安全和评测上的差异。 | 想从源码阅读进入架构抽象的学习者 |
| Agent Runtime 横向对比:任务执行引擎到底负责什么 | 比较简单 Agent Loop、Workflow 和生产级 Agent Runtime 的职责边界。 | 想设计 Agent 执行引擎的学习者 |
工具·MCP·Skills
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Tool Calling 工程化:不只是函数调用 | 理解工具 Schema、参数校验、权限控制、错误处理、Trace 和安全审计。 | 想把工具调用从 Demo 推向生产级的人 |
| Tool System 横向对比:Tool、Skill、Plugin、MCP、Hook 到底怎么区分 | 区分执行能力、能力封装、扩展机制、标准协议和治理入口。 | 想理解 Agent 工具系统边界的学习者 |
| Agent 协议全景 | 区分 Function Calling、Tools、MCP、A2A、Plugin、Skill、Hook 和 Agent SDK 的职责边界。 | 想理解 Agent 协议生态的人 |
| MCP Tool Schema 设计 | 设计工具命名、描述、参数、输出、错误、风险等级和版本管理,让 MCP 工具可发现、可控、可评测。 | 想把 MCP 工具做成平台能力的人 |
| MCP Server 创建实战 | 从工具 schema、返回结构、权限、Trace、stdio/HTTP 选择到测试清单,理解 MCP Server 怎么落地。 | 想把外部工具标准化接入 Agent 的学习者 |
| MCP Client 工程化 | 设计 server registry、tool discovery、权限过滤、schema adapter、连接管理、结果标准化和 Trace。 | 想把 MCP Server 稳定接入 Agent Runtime 的人 |
| MCP Gateway 架构 | 统一治理多 MCP Server 的发现、schema cache、权限过滤、审批、限流、审计和健康检查。 | 想把 MCP 做成平台能力的人 |
| Tool Risk Classification | 按只读、敏感读取、可逆写、高影响写和危险操作定义工具权限、审批和审计策略。 | 想控制 Agent 工具副作用的人 |
| Tool Registry 工程化 | 把工具注册、发现、版本、风险等级、权限、审批、监控和审计做成可治理资产。 | 想治理大量 Agent 工具的人 |
| Agent 工具沙箱与权限边界 | 从工具风险分级、参数校验、文件/网络/命令沙箱、审批和 MCP 权限审计控制工具调用风险。 | 想把 Tool Calling 安全落地的人 |
| Skills 编写:把一次性提示词沉淀成可复用工作流 | 用 SKILL.md、脚本、参考资料和验收标准沉淀博客写作、项目推进、简历整理等重复流程。 | 想让 AI 协作流程稳定复用的人 |
| Claude Code 实战工作流:从需求拆解到可提交修改 | 把 Claude Code 纳入工程流程:任务单设计、范围限定、检查命令、限定提交和输出总结。 | 想用 AI 编程助手做工程化开发的人 |
更多工具与 MCP 专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Tool Idempotency Side Effect | 为会写入、发消息、扣费或删数据的工具设计幂等键、重试、补偿和副作用边界。 | 想避免 Agent 重试造成重复操作的人 |
| Tool Call 回放调试 | 记录 tool_call_id、schema、参数、策略、审批和结果,支持 dry/mock/live replay 排查失败。 | 想系统调试工具调用失败的人 |
| MCP Gateway 运维 | 建立 server health、schema diff、限流、降级、止血、告警和事故复盘机制。 | 想长期运营 MCP 工具生态的人 |
| MCP Observability Metrics | 观测 server health、schema diff、tool success、token exchange、approval 和 sandbox 指标。 | 想运维 MCP 工具生态的人 |
| MCP 安全与授权 | 设计 scope、tenant、role、secret boundary、schema pinning、审计和红队样本。 | 想安全接入 MCP 工具的人 |
| MCP OAuth Authorization Design | 用授权服务器、scope、audience、短期 token、刷新撤销和审批绑定治理 MCP 调用。 | 想把 MCP 授权从 API Key 升级为可审计链路的人 |
| MCP Token Exchange | 用 run、tool、scope、args_hash 和 approval 绑定短期工具执行凭证。 | 想安全设计 MCP 凭证流的人 |
| MCP Server Hardening | 为 MCP Server 增加风险分级、参数校验、超时、错误映射、审计日志和 schema 版本治理。 | 想把 MCP 工具服务安全上线的人 |
| MCP Server Template for Agents | 提供 Tools、Resources、Prompts、Policy、Telemetry、错误结构和测试清单的 MCP Server 骨架。 | 想搭建可治理 MCP Server 的人 |
| MCP 供应链风险 | 治理 MCP Server 来源、版本 pin、schema diff、依赖、沙箱、注入和审计。 | 想安全运营 MCP 工具生态的人 |
| MCP Sandbox Profile | 为 MCP 工具定义文件、网络、命令、资源预算和审计边界,降低工具越权风险。 | 想把 MCP 工具运行环境隔离清楚的人 |
| MCP Version Deprecation | 管理 MCP 工具 schema diff、弃用窗口、迁移说明、旧版本使用量和下线回滚。 | 想长期维护 MCP 工具体系的人 |
| MCP Client 测试 | 用 fake server、contract test、权限过滤、错误映射和注入样本验证 MCP Client 可靠性。 | 想让 MCP 接入可回归、可审计的人 |
| MCP Resources and Prompts Design | 设计 MCP 的 Resources 与 Prompts 能力边界,让工具之外的上下文可发现、可复用。 | 想用满 MCP 三类能力的人 |
| MCP Elicitation 交互设计 | 设计 MCP 工具在缺参时向用户补问的 elicitation 交互、确认边界和安全约束。 | 想优化工具补参体验的人 |
| Code Agent 工程化 | 系统整理 Code Agent 的仓库检查、编辑边界、测试验证、提交规范和安全风险。 | 想把 AI 写代码做成可靠流程的人 |
| Skill 测试与版本管理 | 为 Skill 设计版本号、changelog、触发测试、流程测试、安全测试和回归样例。 | 想让 Skills 长期稳定演进的人 |
| Skill Review Checklist | 像代码审查一样检查 Skill 的触发、流程、渐进加载、脚本、验收标准和安全边界。 | 想提升 Skill 质量的人 |
| Skill 运营手册 | 把 Skill 当成长期资产维护,管理触发、版本、测试、反馈、漂移和废弃。 | 想系统化运营 AI 协作流程的人 |
| Skill 评测闭环 | 为 Skill 建立触发、流程和产出质量的评测样本与回归闭环。 | 想持续提升 Skill 质量的人 |
| AI 编程审查清单:提交前必须检查的 10 件事 | 从文件范围、内容质量、Markdown 格式、构建结果、Git 状态、远端状态审查 AI 输出。 | 想避免 AI 产出质量失控的人 |
| 如何避免 AI 误提交和假验证 | 用文件白名单、暂存区检查、构建日志、commit hash 和远端核对降低风险。 | 想安全使用 AI 编程助手的人 |
评测·可观测·运维
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Evaluation Pipeline:Agent 效果怎么评估 | 从测试集、指标、自动评测、人工抽检、版本对比和失败样本库构建评测闭环。 | 想系统化评估 Agent / RAG 效果的人 |
| LLM Evaluation Scorecard | 把 task success、factuality、grounding、format、tool correctness、safety、cost 和 latency 做成评分卡。 | 想把主观体验变成可比较评测结果的人 |
| Eval Dataset 设计 | 设计 RAG、Tool Calling、长任务 Agent 的评测样本、指标、失败样本库和分层评测集。 | 想把评测从主观体验变成工程资产的人 |
| LLM-as-Judge 与 Rubric 评测 | 设计可解释评分维度、Judge 校准、pairwise/pointwise 对比和自动评测门禁。 | 想让自动评测更可信的人 |
| Agent Trace:如何让 Agent 执行过程可观测 | 用 Run、Step、Tool Call、状态变化和错误事件记录 Agent 的完整执行轨迹。 | 想让 Agent 系统可调试、可审计、可优化的人 |
| Agent Run Replay | 通过输入、配置、上下文、检索、状态、工具、模型和输出快照回放完整 Agent run。 | 想复盘和回归线上失败的人 |
| OpenTelemetry GenAI Observability | 用统一 Trace / Metrics / Logs 串联 LLM、RAG、Tool、审批、安全和成本事件。 | 想接入大模型应用可观测标准的人 |
| Agent Release Gate | 用 code、contract、eval、RAG、safety、cost、latency、ops、product gate 判断版本能否灰度和上线。 | 想让 Prompt、模型、RAG、MCP 变更可发布、可回滚的人 |
| Agent SLO 与 Error Budget | 用任务成功率、证据支持率、工具成功率、审批超时、成本和安全预算定义 Agent 可靠性。 | 想把 Agent 上线后稳定性讲清楚的人 |
| Agent 生产运维 Runbook | 定义 SLO、每日巡检、报警分级、事故排查、止血开关和复盘模板。 | 想把 Agent 真正运维起来的人 |
| LLM 成本与延迟优化 | 从调用账本、模型路由、Prompt 瘦身、缓存、批处理、降级和并发优化线上成本与 p95 延迟。 | 想让大模型应用跑得起、跑得稳的人 |
| Eval Drift Monitoring | 按模型、Prompt、知识库、工具、租户和意图分桶监控质量、安全、成本和延迟漂移。 | 想持续发现 Agent 退化的人 |
更多评测与运维专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Eval Case Lifecycle | 管理评测样本从 candidate、脱敏、标注、审核、active、flaky 到归档的生命周期。 | 想长期维护高质量评测集的人 |
| Batch / 离线评测流水线 | 用异步批处理跑评测集、失败样本回放、Prompt 版本对比、批量摘要和分类。 | 想做 LLMOps 离线流水线的人 |
| 合成数据与对抗评测集 | 用合成样本覆盖 Prompt Injection、越权、工具错误、冲突证据和无答案拒答等边界。 | 想系统提升评测覆盖的人 |
| Agent Benchmark 设计 | 用固定任务集比较 Workflow、单 Agent、多 Agent、模型和框架方案的质量、成本、延迟和安全。 | 想证明 Agent 方案价值的人 |
| Agent Contract Testing | 用契约测试约束 JSON schema、tool args、task state、trace event 和 MCP schema。 | 想让 AI 输出可集成的人 |
| Conversation Regression Testing | 把关键对话路径、fixtures、引用、工具调用和安全边界沉淀成回归测试。 | 想避免版本退化的人 |
| PromptOps:Prompt 版本、评测和回滚 | 把 Prompt 当作可版本化、可评测、可发布、可回滚的工程资产管理。 | 想治理线上 Prompt 变更风险的人 |
| Prompt Regression Testing | 用 smoke、golden、failure replay 和 adversarial 样本防止 Prompt 改动破坏历史能力。 | 想把 Prompt 改动纳入回归测试的人 |
| 多模型路由与 A/B 实验 | 把模型选择变成可配置、可评测、可灰度、可回滚的路由策略和实验体系。 | 想治理多模型上线和切换风险的人 | | Model Rollout Canary | 用 offline eval、shadow、canary、ramp-up 和自动回滚治理新模型上线。 | 想安全替换模型的人 | | Model Provider Failover | 设计 timeout、rate limit、跨供应商切换、功能降级和人工接管的模型容灾策略。 | 想让模型调用更稳的人 | | Agent Latency Budget | 把 queue、planning、retrieval、rerank、generation、tool、approval、retry 和前端渲染拆成延迟预算。 | 想定位 Agent 慢在哪里的人 | | LLM 成本预算表 | 把 token、模型路由、embedding、rerank、工具、评测、人审和基础设施成本拆成可运营预算。 | 想证明 Agent 产品商业化可行的人 | | LLM Semantic Cache | 设计语义缓存、版本失效、权限隔离和误命中监控,降低 LLM 成本和延迟。 | 想让大模型应用更便宜、更快、更稳的人 | | LLM Cost Chargeback | 将模型、RAG、工具和评测成本拆到租户、功能、Agent 和 run,支撑预算、配额和商业化。 | 想把 Agent 成本讲清楚的人 | | LLM Cost Anomaly Detection | 按租户、功能、模型、Prompt、工具和 run 发现成本异常、重试风暴和缓存失效。 | 想提前发现成本失控的人 | | LLM Request Ledger | 把每次模型调用记录成可统计、可追责、可优化的账本事件。 | 想按租户、功能、Prompt 和发布版本分析成本的人 | | LLM 可观测仪表盘 | 把模型、Prompt、RAG、工具、成本、延迟、质量、反馈和安全统一进可 drill-down 的仪表盘。 | 想把模型调用运营起来的人 | | Agent Observability Dashboard Design | 把产品成功、质量、运行时、工具、RAG、成本、安全和 UX 分层设计成运营看板。 | 想用看板解释线上 Agent 表现的人 | | Agent 故障演练 | 主动演练模型延迟、RAG 退化、工具超时、审批卡住、租户隔离和成本失控。 | 想验证 Agent 恢复能力的人 | | Agent 事故复盘模板 | 用事故摘要、时间线、Trace、错误分类、修复动作和回归样本把线上失败沉淀成资产。 | 想建立 Agent 线上问题复盘闭环的人 | | AI Agent 反馈闭环 | 将用户反馈关联 Trace、Prompt、模型、检索和工具调用,转化为评测样本与迭代队列。 | 想让线上反馈驱动持续改进的人 | | Agent Feedback Triage | 把点踩、人工修正和投诉分诊为产品、检索、工具、模型、安全或数据迭代任务。 | 想把用户反馈变成可执行 backlog 的人 | | Fine-tuning 数据流水线 | 从线上样本、用户修正、人工标注、合成数据到脱敏、质检、切分、训练、评测和灰度。 | 想理解微调落地流程的人 |
| Agent Memory 评测 | 评测记忆写入、检索、使用、更新、遗忘和注入防护,避免“记住但记错”。 | 想把个性化记忆做可靠的人 | | Agent Control Plane | 管理模型、Prompt、工具、策略、评测门禁、预算和发布灰度,让 Agent 配置可治理。 | 想把 Agent 平台化、可灰度、可回滚的人 | | Agent 配置治理 | 将模型路由、Prompt、RAG、工具、审批、安全和预算策略做成可版本化、可回滚配置。 | 想治理 Agent 运行策略的人 | | 生产级 Agent Readiness Review | 从任务边界、Workflow、RAG、Tool/MCP、Memory、评测、安全、成本、运维和发布审查上线准备度。 | 想把 Demo 提升成可面试、可上线系统的人 | | Docker 部署工程化:从本地 Demo 到可上线服务 | 从 API、Worker、数据库、Redis、向量库、健康检查、日志和回滚理解部署闭环。 | 想把 Demo 部署成服务的学习者 | | Browser Automation Testing:给网页 Agent 和前端流程做验收 | 用浏览器自动化验证上传、问答、引用、任务状态、工具审批、反馈和运营台流程。 | 想验证 Agent 前端体验的人 | | Browser Agent E2E Acceptance | 覆盖任务提交、RAG 引用、工具审批、失败重试、反馈和 Trace 查看等浏览器端到端验收路径。 | 想把 Agent 前端验收放进 CI 的人 | | Agent Product Metrics | 用 task success、handoff、correction、trust signal、cost、latency 衡量 Agent 产品是否真的有价值。 | 想用指标证明 Agent 产品效果的人 | | Human Takeover 运营台 | 设计人工接管队列、摘要、Trace 查看、审批、重跑、标注和反馈回流。 | 想把 Agent 和人工运营结合的人 | | Eval Failure Clustering | 把评测失败样本按根因聚类成检索、工具、Prompt、模型和数据问题,驱动修复优先级。 | 想高效消化失败样本的人 | | Agent Frontend Telemetry | 采集前端任务视图、审批操作、引用点击和失败重试事件,补齐端到端可观测。 | 想量化 Agent 前端体验的人 |
安全治理
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Agent 安全威胁模型 | 系统整理 Prompt Injection、工具滥用、RAG 文档污染、MCP 越权和数据泄漏防护。 | 想理解 Agent 安全治理的人 |
| Prompt Injection 纵深防御 | 把外部证据降权、检索清洗、tool policy、审批、沙箱和对抗回归组合成多层防线。 | 想把 Agent 安全从提示词提升到系统治理的人 |
| Agent Identity and RBAC | 设计 user_identity、agent_identity、tool_identity、tenant、role、scope 和审批审计边界。 | 想把 Agent 权限和身份讲清楚的人 |
| PII 脱敏策略 | 在输入、RAG、工具、Trace、评测集和缓存中识别、mask、tokenize、hash 或删除敏感信息。 | 想控制大模型数据泄漏风险的人 |
| Agent 审计日志设计 | 记录 actor、action、target、risk、policy、tool schema、输入输出 hash 和脱敏 metadata。 | 想让 Agent 行为可追责、可合规的人 |
| Agent Secret Management | 设计 Secret Store、Policy Layer、Token Broker 和执行层凭证隔离。 | 想防止 Agent 泄漏密钥和凭证的人 |
| Agent 红队演练 | 用 Prompt Injection、越权、危险工具、路径逃逸、审批绕过和 Memory 污染主动攻击系统。 | 想做 Agent 安全上线前验证的人 |
| Agent 租户隔离测试 | 覆盖 API、RAG、向量 metadata、MCP、Memory、Cache、Trace 和 Billing 的跨租户泄漏测试。 | 想把 Agent SaaS 安全底线讲清楚的人 |
| 生产级 Agent 治理清单 | 用 30 个问题检查任务边界、上下文、工具权限、状态恢复、模型治理、评测和回滚。 | 准备把 Agent 从 Demo 推到真实业务的人 |
| LLM Output Safety Filter | 在输出前做 schema、citation、PII、policy、grounding 和合规检查。 | 想控制模型输出风险的人 |
更多安全治理专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| LLM 数据治理 | 用数据分级、脱敏、用途隔离、保留周期和数据集 lineage 管理用户输入、Trace、反馈、评测和训练样本。 | 想把大模型数据用得安全、可追溯的人 |
| Memory Privacy Retention | 设计 should_remember、PII 检测、retention、删除和遗忘评测,控制长期记忆风险。 | 想做可靠个性化 Agent 的人 |
| 数据分析 Agent 安全 | 用语义层、SQL guardrails、权限、cost estimate、脱敏和洞察校验控制 NL2SQL 风险。 | 想做数据分析 Agent 但担心安全边界的人 |
| Agent Approval Workflow | 将高风险工具调用拆成模型提议、策略判断、人工审批、执行层校验和 Trace 审计。 | 想把工具调用做成可控生产流程的人 |
| Agent SaaS 多租户、RBAC 与配额设计 | 设计 tenant、workspace、role、permission、quota、usage、billing 和审计,让 Agent SaaS 可售卖、可隔离。 | 想把个人 Agent Demo 做成团队版 SaaS 的人 |
| AI Agent Enterprise Pilot Plan | 把企业试点拆成范围、用户、数据、禁用能力、审批、指标、风险和退出条件。 | 想讲清楚 Agent 如何从 Demo 进入企业试点的人 |
| Computer Use Agent Safety | 为操作浏览器和桌面的 Agent 设计高风险动作确认、注入防护、沙箱和审计边界。 | 想安全落地 Computer Use Agent 的人 |
面试与作品集
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Agent 系统设计面试题:如何讲清楚一个生产级 Agent | 从 Runtime、Tool、Memory / State、Trace、Evaluation、Security 讲清楚生产级 Agent 系统设计。 | 准备 Agent 系统设计面试的人 |
| AI Agent 面试追问地图 | 从概念、设计、工程、生产到复盘整理面试官的连续追问路径。 | 想把零散题目串成回答体系的人 |
| Agent 系统设计案例库 | 拆解企业知识库、数据分析、Code Review、客服工单、多 Agent 研究助手和 Agent SaaS 6 类设计题。 | 想训练 AI 系统设计面试的人 |
| RAG 项目面试表达:如何讲清楚从文档到答案的工程链路 | 把 RAG 从文档解析、Chunk、Embedding、检索、Rerank、引用和评测讲成完整工程链路。 | 准备 RAG 项目面试的人 |
| 多 Agent 项目面试表达:不要只讲多角色聊天 | 避免"多角色聊天",围绕任务分派、状态共享、工具权限、Trace、结果聚合和评测表达。 | 准备多 Agent 项目面试的人 |
| AI Agent Resume Project Matrix | 把 RAG、Workflow、Tool、MCP、Eval、Security、Cost、Ops 和 Product 能力映射到简历 bullet。 | 想把项目经历写成可验证能力的人 |
| Agent Capability Matrix | 用能力矩阵规划项目、作品集、简历 bullet、面试讲法和系统设计查漏补缺。 | 想系统证明 Agent 工程能力的人 |
| AI Agent 求职作品集路线 | 把个人博客、项目 A、项目 B、面试题库、Skills/MCP 内容组织成可证明能力的求职作品集。 | 准备 AI Agent / 大模型应用开发岗位的人 |
| AI Agent 作品集 Case Study 模板 | 用背景、目标、架构、Workflow、RAG/MCP、评测、安全、难点和 60 秒讲法组织项目文章。 | 想把个人项目讲成可证明能力的人 |
| AI Agent 项目答辩稿 | 用 5 分钟结构、架构讲法、难点讲法、演示顺序和追问模板准备项目展示。 | 准备毕业设计、路演和面试项目介绍的人 |
| AI Agent 面试 30 天复习清单 | 用 30 天把 Agent 基础、RAG、工具调用、工程化、生产运维和项目表达串成复习计划。 | 想系统准备 AI Agent 岗位面试的人 |
| AI Agent 产品需求文档 PRD 模板 | 从用户故事、功能范围、页面交互、权限审批、产品指标和验收标准设计 Agent 产品。 | 想把技术方案转成产品需求的人 |
更多面试与作品集专题
| 专题 | 解决的问题 | 适合读者 |
|---|---|---|
| Agent System Design Whiteboard Template | 用任务边界、Runtime、RAG、Tool/MCP、Data、Observability 和 Governance 组织白板回答。 | 准备 AI Agent 系统设计面试的人 |
| AI 项目设计文档模板 | 用项目背景、目标/非目标、架构、数据模型、权限、评测、监控、风险和展示计划规范项目设计。 | 想把 AI 项目从想法推进到可交付的人 |
| Agent 面试追问库 | 整理 Agent vs ChatBot、失败排查、评测、安全、成本、MCP、长任务恢复等工程追问。 | 已会基础概念、需要准备深挖追问的人 |
| AI Agent Portfolio UI Blueprint | 把首页、项目页、专题页设计成能力证据面板,让招聘方快速看到项目、代码、评测和 Demo 证据。 | 想优化个人作品集网站的人 |
| AI Agent 项目选题库 | 整理 RAG、MCP、LLMOps、语音、多模态、数据分析等 12 个适合求职作品集的项目方向。 | 需要规划个人项目矩阵的人 |
| AI Agent 项目包装:简历、作品集和面试讲法 | 把 RAG、多 Agent、MCP、LLMOps 项目包装成有架构、有难点、有指标、有贡献的求职表达。 | 已有项目但不知道怎么写进简历的人 |
| AI Agent Offer Portfolio Review | 投递前审查项目主线、证据材料、Demo、指标、文章和面试深挖是否互相支撑。 | 准备投递 AI Agent / 大模型应用岗位的人 |
| AI Agent Demo Acceptance Script | 用主路径、权限、工具风险、失败恢复、Trace、评测和指标把 Demo 变成可验收脚本。 | 准备项目演示和面试答辩的人 |
| AI Agent CTO Review Checklist | 从 CTO 视角审查业务边界、数据、安全、质量、成本、运维、维护和商业价值。 | 想让项目答辩更像真实技术评审的人 |
| Agent UI 产品化设计:不要只做一个聊天框 | 设计任务面板、证据面板、工具调用审批、反馈和失败重跑,让 Agent 可控可解释。 | 想把 Agent 做成真实产品的人 |
| Agent UI Pattern Library | 整理 Agent 控制台常用组件:任务流、Trace、工具调用、审批、评测和错误恢复。 | 想复用 Agent 控制台组件模式的人 |
| AI Agent Site UI Optimization Playbook | 总结作品集级导航体验:首页入口、项目证据、专题索引、Demo 和面试材料串联。 | 想快速理解作品集导航结构的人 |
| Agent SaaS 产品化:从个人 Demo 到可卖的产品 | 从多租户、额度计费、团队权限、onboarding、产品指标和运营后台理解 Agent 商业化。 | 想把 Agent 项目做成产品的人 |
| AI Agent Career Readiness Checklist | 用清单自查项目、代码、文章、Demo 和面试表达是否达到投递标准。 | 想检查求职准备度的人 |
| AI Agent Interview Story Bank | 把项目里的难点、事故、权衡和成果整理成可复用的面试故事库。 | 想储备面试故事素材的人 |
| Project B Operator Console UI Blueprint | 拆解 Project B 运营台的任务、Trace、审批和证据面板界面设计。 | 想参考真实 Agent 控制台设计的人 |