AI日报:7B图像模型上新,网页评测终于动手了
今天有两条消息很适合放在一起看。
Qwen 把图像生成和编辑塞进一个 7B 模型里。
网页应用评测也开始让 Agent 真正点进页面操作,不再只看截图和代码。
模型能力还在涨,大家对“做出来”的标准也在变严。
一张图,从生成到修改都在同一个模型里
Qwen 今天开放了 Qwen-Image-2.1 的模型权重。
它把文生图和图像编辑放进同一个模型,视觉生成部分是 7B 参数。
这件事听上去像产品功能整合,实际影响在工作流上。
过去做一张商品图或海报,常要在生成、抠图、局部重绘之间来回切工具。
现在模型原生支持 RGBA 透明图,也能从普通照片里提取主体,直接形成透明图层。
它最多能接收 10 张参考图。
圈选、涂抹、独立掩码这些局部控制也都在支持范围内。
对电商素材、角色设定、信息图和分镜这类反复改稿的活儿,这比“再出一张看看”更实用。
另一个细节是,ComfyUI、Diffusers、vLLM-Omni 等工具在发布当天就给出了支持。
模型能不能进生产,生态接得快不快同样重要。
网页应用,光看好看已经不够了
另一篇很有意思的论文叫 WebCraftBench。
它想解决的问题很直接:AI 生成的网页,看着完整,功能真的能用吗?
这个评测不只检查代码或首页截图。
研究者让 Agent 实际操作网页,再结合代码覆盖率找出没有跑到的功能,再按运行证据给分。
数据规模也不小。
它整理了 369 条真实用户需求和 5088 条验收标准,覆盖 17 个模型生成的 6273 个应用。
在 197 组有效应用对里,评测结果有 168 组与复核后的人类偏好一致,一致率为 85.3%。
这个数字不等于网页应用已经能放心交付。
它说明了一件更朴素的事:评测开始把“能点、能跑、能完成任务”放到台面上了。
做 AI 网页产品时,漂亮首屏只是开始。
表单能否提交、跳转会不会断、边缘输入怎么处理,才是用户真正会撞上的地方。
其他值得扫一眼的消息
- 阶跃星辰发布
Step 5 Preview:总参数 600B、激活参数 27B,支持 100 万 Token 上下文,权重计划在 10 月 15 日 开放。 - Google 开源
AX:面向 Kubernetes 的有状态 Agent 编排器,支持任务暂停、恢复和调试;项目仍在迭代,稳定版前可能出现破坏性变更。 - 腾讯开放
WeVisDoc:提供 2B 和 4B 版本,可把页面图像转成包含公式、表格和阅读顺序的结构化 Markdown。 - TypeSafe AI 向新用户提供 5 美元
Jev 额度,官方称约合 1.2 亿 token。 - 智谱 MaaS 将上线数据内容不留存功能,
Batch API、File API 等持久化能力不在覆盖范围内。
今天能怎么用
如果你在做图像工作流,挑一组需要反复局改的素材试试 Qwen-Image-2.1。
把“生成、抠主体、改局部”连着走一遍,比单看样张更容易知道它有没有省下步骤。
如果你在用 AI 搭网页,给每个关键流程写一条可执行验收:谁输入什么、页面应该发生什么、结果应该是什么。
把这些流程真的跑一遍。
能通过真实操作的页面,才算完成了一半。
Qwen-Image-2.1:https://qwen.ai/blog?id=qwen-image-2.1[1]
WebCraftBench:https://arxiv.org/abs/2609.15387[2]
引用链接
[1]https://qwen.ai/blog?id=qwen-image-2.1
[2]https://arxiv.org/abs/2609.15387