01 监督与评估
监督和评估,本质上是接地,它是和目标函数构建时候,就要一起设计的东西
Llm 要产生价值,不能只是预测下一个 token,而是通过预测下一个token,指引agent或者人类的Action以后产生价值结果。所以我认为有价值的Ai应用,不是长在大模型上的,而是长在大模型下的。从state n,因为Action m,到state n+1,找到干净的监督数据去衡量因果,才是真正让Ai成为连接人类认知、投影工具、真实世界的认知操作系统的关键。比如基于人的认知的反馈、专家偏好,或者直接 agent、人类行为后的数字结果反馈。有一个很有趣的发现,人们总是以为数字是客观的,经常忘记了,数字其实是真实世界运转状态的采样。我上半年经常说,一上了数字化,突然一个正常智力的人,说都都不会话了,走都不会路了。本来是增加了一个数智化工具,多了一些采样反馈,结果反而基本判断能力就全抛弃了。再或者就是拼命不惜代价的去追求数字的准确率,却忽略了针对现状去获取边际收益。比如原本整个体系是拼经验靠感觉通过层层授权做出了60%准确率的决策,原本只需要花1000元提升20%准确率额外获取10万元单店年收益,非要花10万块钱上智慧门店,追求数字精细程度,额外获取10万元单店收益。这是消费品牌面对线下开店智能建设,需要建立监督和评估体系时候,特别容易犯的错。消费品牌的线下开店决策问题,看起来是销售额预测问题,其实是个位置相似性计算问题,或者场景定向问题。(就是转化率预测问题)
我们核心观点就两句话:
1、转化率做监督是更干净的,成本适宜的;
2、基于转化率监督,让模型自己学习品牌之间的关系是唯一出路。