当前位置:首页>排行榜>AI日报:7B图像模型上新,网页评测终于动手了

AI日报:7B图像模型上新,网页评测终于动手了

  • 更新时间 2026-09-21 23:09:56
AI日报:7B图像模型上新,网页评测终于动手了

AI日报:7B图像模型上新,网页评测终于动手了

今天有两条消息很适合放在一起看。

Qwen 把图像生成和编辑塞进一个 7B 模型里。

网页应用评测也开始让 Agent 真正点进页面操作,不再只看截图和代码。

模型能力还在涨,大家对“做出来”的标准也在变严。

一张图,从生成到修改都在同一个模型里

Qwen 今天开放了 Qwen-Image-2.1 的模型权重。

它把文生图和图像编辑放进同一个模型,视觉生成部分是 7B 参数。

这件事听上去像产品功能整合,实际影响在工作流上。

过去做一张商品图或海报,常要在生成、抠图、局部重绘之间来回切工具。

现在模型原生支持 RGBA 透明图,也能从普通照片里提取主体,直接形成透明图层。

它最多能接收 10 张参考图。

圈选、涂抹、独立掩码这些局部控制也都在支持范围内。

对电商素材、角色设定、信息图和分镜这类反复改稿的活儿,这比“再出一张看看”更实用。

另一个细节是,ComfyUIDiffusersvLLM-Omni 等工具在发布当天就给出了支持。

模型能不能进生产,生态接得快不快同样重要。

网页应用,光看好看已经不够了

另一篇很有意思的论文叫 WebCraftBench

它想解决的问题很直接:AI 生成的网页,看着完整,功能真的能用吗?

这个评测不只检查代码或首页截图。

研究者让 Agent 实际操作网页,再结合代码覆盖率找出没有跑到的功能,再按运行证据给分。

数据规模也不小。

它整理了 369 条真实用户需求和 5088 条验收标准,覆盖 17 个模型生成的 6273 个应用。

在 197 组有效应用对里,评测结果有 168 组与复核后的人类偏好一致,一致率为 85.3%

这个数字不等于网页应用已经能放心交付。

它说明了一件更朴素的事:评测开始把“能点、能跑、能完成任务”放到台面上了。

做 AI 网页产品时,漂亮首屏只是开始。

表单能否提交、跳转会不会断、边缘输入怎么处理,才是用户真正会撞上的地方。

其他值得扫一眼的消息

  • 阶跃星辰发布 Step 5 Preview:总参数 600B、激活参数 27B,支持 100 万 Token 上下文,权重计划在 10 月 15 日 开放。
  • Google 开源 AX:面向 Kubernetes 的有状态 Agent 编排器,支持任务暂停、恢复和调试;项目仍在迭代,稳定版前可能出现破坏性变更。
  • 腾讯开放 WeVisDoc:提供 2B 和 4B 版本,可把页面图像转成包含公式、表格和阅读顺序的结构化 Markdown。
  • TypeSafe AI 向新用户提供 5 美元Jev 额度,官方称约合 1.2 亿 token。
  • 智谱 MaaS 将上线数据内容不留存功能,Batch APIFile API 等持久化能力不在覆盖范围内。

今天能怎么用

如果你在做图像工作流,挑一组需要反复局改的素材试试 Qwen-Image-2.1

把“生成、抠主体、改局部”连着走一遍,比单看样张更容易知道它有没有省下步骤。

如果你在用 AI 搭网页,给每个关键流程写一条可执行验收:谁输入什么、页面应该发生什么、结果应该是什么。

把这些流程真的跑一遍。

能通过真实操作的页面,才算完成了一半。

Qwen-Image-2.1:https://qwen.ai/blog?id=qwen-image-2.1[1]

WebCraftBench:https://arxiv.org/abs/2609.15387[2]

引用链接

[1]https://qwen.ai/blog?id=qwen-image-2.1

[2]https://arxiv.org/abs/2609.15387

随机文章