同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。 而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。 针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agenteval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。 配 ...