当前位置:首页>排行榜>旧地图到不了新大陆,数据·环境·评测正一起重写 | 对谈十字路口Crossing

旧地图到不了新大陆,数据·环境·评测正一起重写 | 对谈十字路口Crossing

  • 更新时间 2026-09-22 18:52:29
旧地图到不了新大陆,数据·环境·评测正一起重写 | 对谈十字路口Crossing

1. 现场回顾:一场关于 AI 进化信号的主题沙龙

最近,ZODA 携手十字路口Crossing、Spark Lab,与多位来自 AI 数据、RSI(递归自进化)、视频 Agent 以及其他细分垂直领域的一线 AI 实践者聚集于 AI Hacker House,展开了一场长达 3 小时的高密度研讨。

现场讨论直奔当下最核心的行业命题:当 Agent 走向真实世界,驱动智能持续进化的数据、环境与评测,究竟发生了怎样的根本性变革?

2. 主题分享:Data & Benchmark 的趋势观察

ZODA 负责人孟卓飞带来了题为《站在十字路口,Data & Benchmark 的趋势观察和思考》的主旨分享。

他从近三年模型评测发展和开源协作范式的变化出发,抛出了一系列关于 AI 数据、评测的趋势洞察,引发全场深思:

2.1 AGI 的标准是“移动的靶心”,人类经验也在重塑

在探讨任何关于大模型评估的问题前,我们首先需要回答一个哲学性与实用性交织的问题究竟什么是 AGI通用人工智能)?

正如图灵奖得主 Geoffrey Hinton 在 2024 年接受采访时所指出的:如果放在 20 年前,人们大概会认同 GPT-4 或 Gemini 已具备与人类相当的通用智能。但现在 AI 已经能做到这些了,人们却想要改变测试标准。("But now that AI can do that, people want to change the test.")

这种“移动的靶心”现象暴露了人工智能评估的核心困境:对 AGI 的定义是动态的,且总是随着能力的突破而不断改变。

当模型从“答题”走向“执行”,人类经验的定位也发生了根本性的重塑。过去,人类经验直接进入“亲手执行”的环节(编写代码、标注特征);而当下,人类经验正被重塑为机器学习与验收的条件,人类经验不再直接提供解法,而是转变为构建规则、环境与裁判的元能力。

2.2 数据产业的“代际”挑战

数据是人工智能发展的燃料,但每一轮模型能力变化,都会改变数据产业的交付单位:

  • 1.0 标注时代:以传统机器学习、计算机视觉(CV)与自然语言处理(NLP)为核心技术范式,交付单位为标签(Labels),重点解决“这是什么”的基础认知问题。

  • 2.0 人类反馈时代随着监督微调(SFT)、基于人类反馈的强化学习(RLHF)等后训练方法兴起,核心交付单位转变为偏好与示范(Demonstrations & Preferences),通过排序、对齐和人类偏好学习,解决“哪个回答更好”的输出对齐问题。

  • 3.0 交互环境时代:全面进入强化学习与环境交互范式,核心交付单位升级为交互环境(Environments),核心目标是评估智能体“能否在复杂、动态、长程的环境中完成任务”。

从标签,到偏好和示范,再到交互环境,数据交付单位正在变大。规模优势不会自动跨越代际,传统的标注型数据公司在面对需要具备专业领域知识(如复杂代码重构、物理仿真环境搭建)的 Agent 评测与训练需求时,正面临严重的产能缺口与能力断层。

2.3 评测演进:从“跑个高分”到“经历一段轨迹”

评估传统 LLM 的好坏看的是单个 Prompt 的输出质量,而评测 Agent 的基本单位则是一段包含“观察→工具调用→遭遇失败→自我恢复→完成任务”的完整轨迹(Trajectory)。正因漂亮的 Demo 展示与稳定的工业级交付之间隔着巨大鸿沟,评测必须从单一的“成功率”拓展为包含结果、稳定性、代价以及越权边界的综合考量。

同时,随着交互环境取代静态样本成为新交付物,Benchmark 已深度介入训练过程。这种“评测即训练”让传统固定数据集极易面临污染、饱和与错位的困境,这要求评测基础设施实现“练习场(训练)”与“裁判席(验收)”的隔离,依靠滚动新题与独立保留集,为泛化能力提供更可信的凭证。

此外,在合成数据与 RSI 范式下,数据飞轮的瓶颈也已从“生成器(Generator)”转向“验证器(Verifier)”——缺乏可信、防作弊的裁判,海量生成便毫无意义。

在探讨近期备受关注的 RSI 概念时,ZODA 社区基于对前沿学术实践的梳理指出:当前 RSI 虽在代码自修改与记忆更新上展现出增益,但其证据边界依然受限于外层评估逻辑与预算约束。未来的核心资产,必然是“更真实的问题缺口 × 更可信的裁判 × 更可复用的环境”。

3. 对谈交锋:多维场景下的新变量

除了底层趋势的拆解,现场多位一线实践者也从各自的纵深战场分享了一手的方法论与工程挑战:

  • RSI 与进化信号:Evolvent AI 联合创始人陈麒光深入探讨了从“静态训练数据”向“动态进化信号”转化的范式,剖析了在递归自进化机制下,数据验证与反馈信号的设计逻辑;

  • 专家数据:Humanlaya & TalentsAI 生态负责人葛壮飞分享了高质量专家数据如何打破传统的知识传递链路,成为赋能 AI 并实现商业变现的新机会;

  • 多模态与视频:One2X 数据负责人 Yusi 聚焦 Video-Gen 模型评测,结合以 Astra 为代表的前沿进展,拆解了复杂视频生成与动态创作场景下的新评测指标与生成变量;

  • 物理世界与工程落地:华信咨询设计研究院 FDE 工程师宋涤非则将视线拉回物理系统工程,展示了 Agent 在面对复杂物理约束、工程逻辑与实机验证时的构建思路与评价体系。

随后的圆桌环节由大厂 AI Data 产品经理 Jing 主持,Fargo Wealth AI 负责人施宏斌(CFA)与各位嘉宾展开了跨界对谈,将资本市场、金融场景与物理工程、数据底座的真实挑战横向贯通,共同探讨了“从 Demo 到商业落地”之间的真实距离。

4. 1 亿元,寻找敢于向大模型“提出好问题”的人

大模型的换代终将加速,但在浪潮褪去后,唯有真正有价值的贡献能够跨越周期,这也是 ZODA 选择扎根于数据与评测开源基础设施的真正原因。

为了推动真正具备工程意义的 AI 评测范式落地,ZODA 正面向全球专家、科研机构与产业团队发起共建招募。ZODA 在首年规划了 1 亿元的资源池(包含 GPU、Token 与现金支持),旨在通过开放中立的协作机制,专项扶持具备潜力的 Open Benchmark 项目建设,以及能够真正暴露问题、具备可信判断的 AI 数据与评测基础设施

只要你有被忽视的真实痛点场景,或是有可落地的验证方法,ZODA 的大门始终敞开。让更多人能够提出问题、共同定义进步——这是我们正在搭建的生态,也是我们献给大模型时代的基础设施。

欢迎加入我们,一起碰撞出新的解法,Fueling AI Together.

随机文章