Appearance
Agent 评估与持续进化
**做Agent的第一步不是写代码,是设计”思考过程”。
真正有价值的是闭环:
Run > Trace Eval 归因 Skill / Dataset / Reward 下一轮变强Agent 不应该只是一次性完成任务,而应该像一个持续工作的系统:能记录、能复盘、能沉淀、能升级。
Harness 解决的是 Agent 的“可运行",下一阶段真正重要的是 Agent 的“可学习”。
谁能把执行轨迹、评估结果、人工反馈和成功经验变成持续进化的数据飞轮,谁就会在下一波Agent竞争里占优势。