当前位置:首页>排行榜>“书生·明决”:能看图、会决策,七项评测平均分超 Jev

“书生·明决”:能看图、会决策,七项评测平均分超 Jev

  • 更新时间 2026-09-30 10:54:27
“书生·明决”:能看图、会决策,七项评测平均分超 Jev

近日,上海人工智能实验室推出决策模型书生·明决(Intern-Decision),发布 0.8B、2B、4B 三个版本。此前 Jev、Laya 让“模型只做判断”受到关注,书生·明决进一步把图片加入输入:模型可以结合文字和画面,从给定选项中选择答案、评分,或给出是非问题的概率。

在项目公布的七项基准评测中,**4B 版本平均得分为 90.02%,Jev 为 88.74%**。单张 RTX 4090 上,4B 版本处理指定测试请求的平均时延为 44.16 毫秒,Jev 为 109.70 毫秒。这两组数字来自项目设定的测试环境,实际应用仍需按自己的任务重新验证。

书生·明决与 Jev 等模型的七项评测平均得分

图源:魔搭 ModelScope 社区;表中 Brier、ECE 为概率质量指标,数值越低越好。

视觉能力让它可以直接根据游戏画面选择下一步动作,也能用于图形界面操作。项目还展示了按置信度分工的方式:常见问题交给轻量模型快速判断,拿不准的再转给大模型处理,在速度与准确率之间取得平衡。

对业务系统来说,值得关注的是这种“看见画面 → 输出结构化判断 → 决定下一步”的能力。截图工单、页面操作等场景,都可以沿着这条思路探索;最终流程仍要结合业务规则和人工复核。

感兴趣的同学,可以拿来私有化部署,感受一下它的能力。也可以自己微调一下,试试。

Jev 爆火,但怎么落地?我把它接进了车险理赔项目(附源码)

JEV 劲敌,本地部署 Laya:给工单系统做智能分流,数据不出内网

资料:魔搭 ModelScope 社区原文 · 项目与评测数据:

https://github.com/InternLM/Intern-Decision/blob/main/README_zh-CN.md

随机文章