GPT‑6.1 Sol,这是 GPT‑6 Sol 的升级版,在智能体编程、计算机使用和专业工作方面表现尤为出色。它让 Sol 在高难度任务上的表现更接近 GPT‑6 Astra,而标准输入和输出 Token 价格仅为 Astra 的五分之一,让开发者在相同预算下有更多空间构建和运行能力强大的智能体。
GPT‑6.1 Sol 以 Sol 的价格提供接近 Astra 的性能,成为目前同等性能下最具成本效益的模型。缓存输入每百万 Token 仅需 0.10 美元,比标准输入价格低 95%,让需要在多次请求中复用上下文的智能体工作负载更加经济实惠。
GPT‑6 Astra 仍是我们综合能力最强的前沿模型。无论是用户希望更频繁地完成的重要工作,还是 API 客户大规模构建和运行应用的需求,GPT‑6.1 Sol 都为能力与成本提供了新的平衡。
从编写和调试代码,到理解文档和执行多步骤业务工作流,GPT‑6.1 Sol 在复杂专业工作中的表现相较 GPT‑6 Sol 有了显著提升。在其中多项评估中,它以显著更低的成本实现了接近 GPT‑6 Astra 的性能。
DeepSWE v1.1 评估模型在真实代码库中完成复杂软件工程任务的能力。在这项评估中,GPT‑6.1 Sol 以约五分之一的成本达到与 GPT‑6 Astra 相当的水平,同时以更低的推理强度和成本,比 GPT‑6 Sol 的最高得分高出 6.4 个百分点。
GDP.pdf 衡量模型利用复杂 PDF 文档(包括表格、图表、示意图和小字细节)回答专业问题的准确程度。在所测试的各档推理设置下,GPT‑6.1 Sol 的得分均高于带回退机制的 Opus 5.5,而单任务成本不到其一半。它还以约五分之一的单任务成本,接近 GPT‑6 Astra 的业界领先性能。
在我们的对齐评估中,GPT‑6.1 Sol 相较 GPT‑6 Sol 有了显著提升,更接近 GPT‑6 Astra 的水平。GPT‑6.1 Sol 能更坦诚地说明自身局限,也能更可靠地尊重用户意图和遵守安全约束。在高难度评估中,无论是如实告知搜索工具故障、遵守明确限制,还是在智能体任务中避免未经授权的结果,它的失误率均低于 GPT‑6 Sol。我们未观察到它有任何绕过自动化安全审核机制的尝试,与 GPT‑6 Astra 和 GPT‑6 Sol 的表现一致。
#ChatGPT #OpenAI