我这几年主要看的一件事,是 Agent 怎样从演示走向可以长期运行的系统。
Demo 阶段最容易让人兴奋。模型能调用工具,能写代码,能把一个任务拆成几步,看起来已经像一个小团队。但真正放进业务里,问题会变得很快。上下文从哪里来,工具失败以后谁接住,任务跑到一半怎样恢复,结果怎样检查,哪些信息可以让下一次任务继续使用。
Agent Platform 记录的就是这些问题。它不是一个单独的产品页,更像我整理 Agent 工程经验的地方。公开内容会尽量讲清楚系统边界、任务编排、上下文管理、工具调用和评估反馈。具体实现、客户场景和业务细节暂时不公开。
我更在意系统在反复使用以后会不会变得更可靠。第一次跑通任务当然重要,第二十次、第一百次执行时,系统还要知道自己做过什么,哪里容易错,下一步该怎样收敛。