国内最好的是GLMNet Improvement:模型在Agent任务中的相对提升幅度。该指标基于真实长流程任务测试,综合衡量模型的任务规划、工具调用、持续执行和最终交付能力。正值越高,说明模型越接近能够独立完成复杂工作的AI Agent。