根据 Beating 的监测测试显示,在运行 Kimi K3 的 6 个 AI Agent 框架中,Claude Code 的平均任务成本达到 1.47 美元,几乎比 Hermes Agent 的 0.39 美元高 3.8 倍。在任务执行速度方面,Claude Code 的耗时最长,为每任务 347.6 秒;而 Pi Agent 的最快耗时为每任务 161.7 秒。

在相同模型、不同框架下,成功率最多相差 4 个任务(共 26 个任务),平均成本差异接近 4 倍,执行时间差异超过 2 倍。