高效商业 Agent 的解剖指南
Anthropic 总结商业 Agent 的生产架构:用单一 Agent、Skills 和业务工具承载复杂购物与商家任务,并系统处理延迟、缓存、长期记忆、安全护栏、评测和跨团队发布。
- Claude
- Commerce Agent
- Agent Architecture
- Prompt Caching
- Evals
- Anthropic
EDITOR’S SELECTION
亲自筛选的文章、报告与访谈,强调可吸收性与启发感——值得长期保存的一手资料与深度解读。
57篇 · 持续收录中
2 篇
Anthropic 总结商业 Agent 的生产架构:用单一 Agent、Skills 和业务工具承载复杂购物与商家任务,并系统处理延迟、缓存、长期记忆、安全护栏、评测和跨团队发布。
Anthropic 针对 Claude Fable 5.1 的官方提示指南:如何选择 effort、让 Agent 持续汇报并完成整个任务,以及正确处理工具批量调用、对话历史、范围控制、子 Agent 与视觉任务。
12 篇
Factory 的 ProgramBench 实验说明:Coding Agent 在大型任务中往往不是能力不够,而是过早认定完成;一套独立、可执行的完成标准,能显著提高最终行为完整度。
Warp 把一次性的人类反馈沉淀成技能文件:内层基础技能干活,外层改进技能定期消化反馈并发起 PR,让 Agent 的输出随使用越来越准。
以 TrueForge 网页研究 Agent 为例,完整拆解模型循环、MCP、Skills、沙箱、子 Agent、上下文压缩、审批门禁与持久事件流如何共同支撑长任务。
Andrew Ng 梳理 AI 工程师构建可靠应用所需的六组核心能力:LLM 基础、数据增强、Agent 系统、评测驱动开发、生产运维与机器学习基础。
Marek Minor 复盘一年时间里如何手工设计、校准、迁移并交付 Cursor 的 600 多枚图标,以及怎样把一致性变成可持续的设计基础设施。

从模型、输入输出 Token、提示词缓存和上下文管理出发,解释怎样用更少的无效消耗完成更多工作。
解读 ngrok 的《Compression is prediction》:压缩率为何取决于预测概率,算术编码、信息熵与 LLM 的交叉熵训练又如何指向同一套数学。

Nick Nisi 复盘自己为何错把 pi 当成更快的 Claude Code,以及可扩展的 Harness 如何让工具从外部脚本真正进入智能体会话。

MiniMax 团队在 Reddit AMA 中回应 H3 开源、2K 重生成、稀疏注意力、低步数版本、图像模型与远景画质等关键问题。
10 篇

用通俗的方式解释 CLI、Harness、Skills、HTML 与 GitHub,帮助非技术用户建立一套实用的 AI 基础认知。
Dex Horthy 使用 SlopCodeBench 测试 Opus 4.8、Sonnet 5 和 Opus 5,衡量前沿模型能否在需求逐步揭示的过程中持续演进代码库。
Miguel 讲述 camelAI 如何用 Durable Objects、SQLite、R2、Pi、Code Mode、动态 Workers 和按需 Linux 容器取代常驻虚拟机。

HyperFrames 介绍 Claude Design 如何基于品牌设计系统生成可直接使用的 HTML 和 CSS,以及如何交给 Claude Code 完成更稳定的视频制作流程。
从核心循环开始,逐层用 CrewAI 重建 Claude Code 风格的智能体 Harness:工具、规划、子代理、沙箱、人工审批、记忆与检查点。
没有匹配的记录。