几个月前,我们评测了蓝戟Arc Pro B70显卡,这张显卡用的是满血版的BMG-G31核心,32个Xe2-core。然后BMG-G31其实还有另一个版本,20个Xe2-core的,型号是Arc Pro B65。你也许注意到了Arc Pro B60也是20个——别单看数字做决定。Arc Pro B60用的是Arc B580同款的BMG-G21。这导致了显存上的差别,Arc B70和B65都是32GB GDDR6显存,而B60是24GB。不过它们的显存速度都是19Gbps,只有Arc Pro B50在各方面上都是个例外。哦对,正如标题所示,今天我们评测的是Arc Pro B65,差点忘记说了。这一次的Arc Pro B65仍然来自英特尔锐炫显卡首家核心伙伴——蓝戟,相信大家已经很熟悉了。还有一件事必须要在开头说的是,这次我们有两张B65,加起来总共64GB显存,这太棒了。考虑到我们目前并没有HEDT平台在手,这就是极限了。稍有变化的规格
显卡规格参数
型号 | 蓝戟Intel Arc Pro B65 TF 32GB 专业显卡 |
核心 | BMG-G31 |
Xe2-core数量 | 20 |
光刻类型 | 台积电N5 |
显卡时钟频率 | 2400MHz |
GPU 性能 | Int8: 197TOPS |
显存大小 | 32GB GDDR6 |
显存速度 | 19Gbps |
显存位宽 | 256 bit |
显存带宽 | 608GB/s |
显示 | 3个DP2.1+1个HDMI2.1 |
PCI Express | 5.0 |
OpenGL | 4.6 |
TBP | 200W |
电源接口 | 2*8PIN |
尺寸 | 268*111.1*40.1MM |
编码/解码 | AV1,H.265,H.264,VP9 |
操作系统 | Windows 10/Windows 11/Linux |
超 能 网制 作
无需多言的外观
既然Arc Pro B65和Arc Pro B70采用了同一颗核心,显存配置也相同,再加上专业级显卡的定位,这些要素共同构成了一个点,那就是Arc Pro B65的外观和我们早些时候评测过的Arc Pro B70不会有什么太大的变化:低调的原色牛皮纸盒、涡轮散热设计和方方正正的黑色外壳,供电接口也是双8-pin,就是这样。这两张卡在外观上如此高的一致性让我觉得实在没有什么重复叙述的需要,虽然为了填充字数我大可以直接借用一下Arc Pro B70的评测(反正也是本人写的),但真要这样做的话也未免过于不负责任了,所以还是请大家看看照片吧。老实说除了侧边的B65字样,你就找不到其他和蓝戟Arc Pro B70不同的点了——单凭数字的变动可以撑起的鸿篇巨制大概只有周年贺词,评测是做不到的。测试平台
测 试 配 置 |
CPU | AMD 锐龙 9 9950X |
主板 | 微星MEG X870E GODLIKE |
内存 | 芝奇皇家戟 DDR5-7200 CL36(24GB x2) |
显卡 | 蓝戟Intel Arc Pro B65 TF 32GB 专业显卡 x2 |
硬盘 | 三星 990 Pro 1TB 金士顿 NV2 2TB |
散热器 | 雅俊GRATIFY AIO 5 |
电源 | 海韵Vertex PX-1200青龙 | 1200W |
软件配置 |
操作系统 | Microsoft Windows 11 25H2 / Ubuntu 24.04.4 |
超 能 网制 作
本文为蓝戟委托的技术验证测试 / 联合体验推广内容,测试过程执行超能网标准测试流程。
测试平台有一点点变动,主要还是主板方面的:开头我已经说了我们没有HEDT平台,因此目标就变成了一块有着两条PCIe x16全长插槽的主板,我选的是微星MEG X870E GODLIKE,速度规格上,它的第一根插槽最高是PCIe 5.0 x16,第二根则是PCIe 5.0 x8,都来自CPU。两根插槽满上的话,就平分x16,都变成PCIe 5.0 x8。比较重大的变化是系统环境。我分别在Windows 11和Ubuntu下都进行了测试。其实就AI负载来说,Linux的优先级肯定是要比Windows高的。只不过完全忽视Windows也不太好,总有人是用Windows的,对吧?而且UL Procyon的这些测试也没有Linux版本。Windows环境,主要是单显卡
Windows 11环境主要测试的是单显卡设置。当然,由于一张Arc Pro B65也有32GB显存,能做的事情还是不少的。举个例子,Qwen 3.8 27B的Q4_K_M量化gguf肯定放得下,还能开192K上下文。先来看经典的UL Procyon测试,虽然里面所用的模型都比较旧,但是它们毕竟是作为基准测试存在的,模型更新太快的话就失去基准的意义了。不过在这里可以倒是可以看出英特尔专用的OpenVINO和通用的ONNX DirectML运行时之间的效率差距。接下来是ComfyUI,这里有一个比较值得说的一点就是蓝戟不仅做了卡,还做了份指南文档,并把带Intel XPU加速的ComfyUI打包好了上传到网盘,这对于用户,特别是国内用户来说是个好事。毕竟配置环境确实很烦,就算交给agent做也耗token,能开箱即用自然是最好的。不过如果网络条件允许的话,我建议还是直接去ComfyUI官网下载ComfyUI Portable,有支持英特尔显卡的版本,也能够一键启动,下面的测试我就是用这个版本,因为诸如Qwen Image 2.1这些新模型还是要新版ComfyUI才能开得起来。以ComfyUI官方的Minimax H3工作流(带8步加速Lora)为例,我们生成一个640 x 640的5秒视频。如果在写好提示词的情况下,仅更改种子进行抽卡的话,每次生成大约需要用时2分半。如果更改提示词的话,因为text encoder部分要重新加载到显存里,所以耗时也会相应增长。通过更换量化版模型,是可以有进一步优化空间的,比如说这个int8的text encoder实在大了点,可以换成q4 gguf的。新出的Qwen Image 2.1是图像生成和编辑模型,对于显卡的压力是比较小的,我们这里用的也是ComfyUI官方的工作流,一张图的生成速度在45-46秒。最后是LLM运行,在这里我们选的是Unsloth Desktop,它的推理引擎也是用的llama.cpp,和LM Studio这些应用一样。模型则是local AI这边最近非常火热的Qwen 3.8 27B,因为是单卡运行,所以我们选的是UD-Q4_K_M量化,其中UD指的是Unsloth Dynamic v3.0量化方法。通过截图可以看到,Qwen 3.8 27B UD-Q4_K_M的生成速度在20-22token/s左右。不过说真的,llama.cpp的vulkan后端在Arc Pro上表现得不是很稳定(Arc Pro B70的时候就这样了),偶尔会报设备错误。因此还是让我们快进到双显卡环节吧。Linux环境,多显卡为主
双显卡自然是Linux,我们安装的发行版是Ubuntu 24.04.4。和NVIDIA或者是AMD一样,英特尔也提供了docker镜像,名为LLM Scaler,其中LLM Scaler vLLM是给文本生成用的,而LLM Scaler Omni是用于图像生成的,这点看名字就知道。LLM Scaler vLLM docker给你包完了作为英特尔Arc Pro显卡的配套解决方案,LLM Scaler拥有非常多的优点,除了开箱即用的多显卡支持、多模态模型支持这些个优点外,个人觉得比较值得说的就是这个INT4和FP8在线量化推理服务,以及对FP8模型的支持——先说后者,熟悉Battlemage架构的各位应该知道,这一代的XMX引擎并不原生支持FP8,而LLM Scaler在软件层面实现了转换,也就是说,显存里面可以放FP8模型节约空间,跑的时候就按BF16去算。前者呢则是可以让你下载BF16的模型,但是加载时实现转换,变成FP8或者INT4模型从而降低显存占用,非常方便。我们会通过gemma-4-26B-A4B-it这一个模型去展现这点。先来看最近非常火热的Qwen3.8-27B-FP8,它是被测的三个模型里唯一的dense模型,权重大小约为30GB,摊到两张卡上各约15GB,显存毫无压力,因此上下文可以开得更长一些。单人用时,每生成一个 token 要 18.5 毫秒,合每秒51 个 token。这个数字之所以低,是因为dense模型每生成一个字都必须把 27B 权重完整地从显存里读一遍,单条序列的访存请求根本填不满两张卡的带宽,硬件绝大部分时间在等数据。随着并发数的上升,输出速度和延迟也随之上升了,而16并发看起来是个不错的选择,每人 21.9 token/s,到 32人就掉到 13 token/s 了。因为Qwen还没有开源他们最新的35B-A3B模型,所以我们就只能用早前的版本,也就是Qwen3.6-35B-A3B-FP8来测试Arc Pro B65运行MoE模型的表现了。和27B勉强能用BF16权重不同,35B的BF16版本体积来到了72GB左右,两张卡放不下。性能方面,因为是MoE模型,每 token只激活约3B,输出速度和每字延迟自然要比dense模型好上不少——单用户就能跑到144 token/s,每字延迟在6.09毫秒。而且就算是32并发,每人还能分到 23 token/s,这速度对于local AI来说仍然是可以接受的,延迟也在38.04毫秒。gemma-4-26B-A4B-it的BF16权重大小约为52GB,塞入这两张卡里面也勉勉强强。通过llm-scaler的在线量化,模型本身的体积可以压到24GB。和Qwen3.6-35B-A3B-FP8一样,这个模型在两张Arc Pro B65上的速度也是比较快的,单人使用时 80 token/s、每字 12.09 毫秒;一路加到 32 并发,总速度来到532 token/s,大概是每人16.6 token/s,总的来说,16并发及以下是舒适区,和Qwen3.8-27B-FP8有点像。至于说BF16转FP8,FP8又转BF16中间有多少性能损耗,这是个值得思考的问题,但是从易用性这个角度上去说的话,我觉得llm-scaler这套还是很值得用的,再说了,如果真要追求吞吐量和延迟,llm-scaler还提供了INT4在线量化呢。总结
对于Local AI来说,显存有多重要估计是不用我多说了,在游戏看来相当够用的16GB,对于AI来说还真不算什么——在本地部署这块,VRAM越大越好总是没错的,毕竟就算GPU核心性能再强,显存放不下的话处理就是比较麻烦。而蓝戟Arc Pro B65同时具有两个很吸引人的特性:第一,它的单卡显存达到32GB,而且是19Gbps的GDDR6;第二,和显存规格接近的显卡相比,它在售价上非常有竞争力,电商平台上才8999元,对于多卡平台而言,可以说数量越多性价比越有。当然,硬件是一回事,有没有配套的软件支持也是很重要的一点。在测试中,我能感受到英特尔的llm-scaler确实足够易用。之前我在NVIDIA平台怎么操作的vLLM,现在在英特尔平台上就怎么操作,顶多改点参数,不用再大改些什么,这是不错的。对于FP8这些主流格式的支持也到位,直接扔进去就能跑,而不用关心它是怎么转换的,也是值得称赞的一点。本次用到的测试脚本:https://github.com/1oogiraffe/lsv-b65-scripts
LLM Scaler文档:https://github.com/intel/llm-scaler/blob/main/vllm/README.md
最后,我把本次用到的docker和vllm测试脚本放到GitHub了,有需要的各位可以自取,或者在此基础上让agent捏一个更好的...本次测试结果仅对本次样品负责,无法保证其它市售商品都能达到完全一致的表现,产品在生命周期内可能会因供应链变动而调整元器件,不自动延展适用于该型号未来可能出现的改款或变动批次。
超能网公众号
扫码关注我们,浏览热门硬件评测
随时查看最新天梯榜