7.36美元的测评结果
同一道 FreeCAD 建模题 · 全部实测 · 真金白银跑出来的账单。 14 个大模型独立编写 FreeCAD Python 脚本,本机 FreeCAD 1.1.4 无界面执行并导出 STEP / A3 图纸;得分由评测方重新导入几何实测得出,非模型自报。
本轮账单总花费 $7.36:Claude $6.74(91.7%)· GPT $0.38(5.1%)· Gemini $0.23(3.2%)。
最便宜的 gpt-5.6-terra 只花 $0.04(0.9 折),最贵的 claude-fable-5-1 花 $6.50——差 162 倍,成绩只差 1 分。
4 个模型的成绩
成绩小结:4/4 几何全对(包络 · 片数 · 体积三项全中,无一超差粘连);但 4/4 的图纸都栽在 A3 中文图框的可编辑字段替换失败——标题栏出现「待确认」大字压盖。贵 ≠ 强。
4 个模型生成的效果
每张图就是该模型真实导出的 A3 图纸(未做任何修饰),名次徽章与实测得分已直接烙在图上。
① claude-fable-5-1 · $6.50 · 93 分图3
② claude-opus-5-5 · $0.24 · 95 分图4
③ gemini-3.8-flash · $0.23 · 94 分图5
④ gpt-5.6-terra · $0.04 · 92 分图6
大模型测评总榜 · 14 个模型
得分权重:几何包络 30 + 体积合理性 20 + 实体独立性 20 + 图纸可用性 20 + 交付完整度 10。全部数据由评测方重新导入 model.step 实测。
评测环境:Windows 11 · FreeCAD 1.1.4(freecadcmd 无界面)· Playwright/CDP 统一渲染 · 数据快照 2026-09-30
【延伸阅读】