ExplorationBench让模型面对陌生的可执行规则,观察它能否靠主动试验逐步弄懂。这里积累的是对话中的发现,不是边探索边更新模型权重。受控环境里的好成绩,也不能直接等同于发现现实世界的科学规律。