导读:作为目前市面上最领先的两个大模型公司的最顶尖模型:Fable 和 Astre,在技术路线和应用场景上都出现了一些分叉。
我们如今如何工作
Fable 5.1 对比 Astra:各自的优势所在
一个模型可以用其输出惊艳你,却依然在作为协作者时让你感到沮丧。随着 Fable 5.1 和 GPT-6 Astra 在本周双双发布,在它们之间做出选择意味着你需要明确:你究竟想让模型做什么——以及你希望如何与它协作。
在我们最新的订阅者专属营地中,我们并排对比了这两个超级模型的表现。正如 Dan Shipper 所指出的,这些对比有助于我们阐明对好工作的标准。一个更漂亮的应用程序可能会输给一个点击次数更少的程序。一个更强的初稿可能来自于那个更难驾驭的模型。
以下是两者的各自优势所在:
对于哪一个更适合作为日常主力,我们产生了分歧。 Kieran Klaassen 更偏爱 Fable:在它的工作成果上进行构建更容易,而无需要求它撤销不想要的添加内容。然而,我发现对于写作任务,Astra 在来回交互中更容易驾驭,而 Fable 则需要在前期提供更多上下文。我们寻找的并非同一种协作者。
Fable 的应用程序需要的点击次数更少。 高级编辑 Jack Cheng 要求两个模型开发一个用于将手写日记数字化的应用程序。Fable 的程序让他只需将页面举到 Mac 的摄像头前、按空格键,然后翻到下一页即可。而 Astra 的程序则拥有更暖的视觉风格、更多的按钮,并且需要在 Jack 与扫描页之间做出更多选择。Dan 更喜欢 Fable 更简单的方案。
Fable 弄对了图表。 评估负责人 Mike Taylor 展示了一张描绘“复合工程循环”的幻灯片,早期的模型在排版时曾举步维艰。Fable 5.1 生成了一个可用的版本。Astra 几乎做到了,但却添加了一些 Mike 觉得莫名其妙的红色小修饰。在这个测试中,这些多余的装饰反而成了减分项。
Fable 的初稿赢得了我的青睐。 我向两个模型展示了它们对我称之为《在自动化之后,Dan 是错的》这篇随笔的尝试,Dan 也参与了通话。Fable 的版本具有我想要的更多温度和具体细节。在较短的写作测试中,Astra 可以更清晰、更直白,但有时会将两个观点拼凑在一起却没有解释其间的联系。两者都需要修改。我对与 Astra 协作的偏好并没有决定我会保留哪种文体。——Katie Parrott
我们将在未来面向 Every 订阅者的营地中带来下一轮实验。
知识库
《Vibe 评测:GPT-6 Astra 是一个拥有某些坏习惯的重大升级》(作者:Katie Parrott 与 GPT-6 Astra) / Vibe 评测:OpenAI 的新模型在写作、计算机使用和视觉设计上实现了重大飞跃。它在大约 25 分钟内草拟了 Every 自身评测的第一版,在 Every 的高级工程师基准测试(Senior Engineer Bench)中得分 71 分(满分 100 分),高于 GPT-5.6 的 56 分。但 Katie 和 Dan 发现它过度构建,把简单的任务包装在落地页文案中,并且很难判断自己的工作何时结束。他们的结论是:本周早些时候发布的 Anthropic Fable 5.1 仍然在交付可用产品方面拥有更好的直觉。
《Vibe 评测:Fable 5.1——Anthropic 再次强势回归》(作者:Katie Parrott 与 Dan Shipper) / Vibe 评测:由 Every 团队在周二发布前测试的 Anthropic Fable 5.1,依然能够处理让最初版本物有所值的繁重编码工作,并且现在使用的是平实、可读的文体,而不是那种带有标志性的“Claude式”腔调。Marcus Moretti 测得它以大约 60% 的时间和一半的 Token 数量匹配了 Opus 5 的智能体结果。Kieran 仅凭一个提示词就重建了一个可用的 Proof 版本。问题在于:5.1 越过了提示词的限制——在一个允许 8 到 12 条支持性引文的简报中,它返回了 43 条,其中有些在源材料中根本找不到。
《复合写作:终极指南》(作者:Katie Parrott 与 GPT) / 指南:在花了两年时间教 AI 像她一样写作之后,Katie 正在将该系统开源。复合写作将模型视为可重复循环中的合作伙伴——构思与访谈、大纲、草稿、评审、定稿——因此每个会话都在复合累积,而不是从头开始。核心前提:好的写作源于好的素材和艰难的反复切磋,而不是一个巧妙的提示词。
《Every 的一名员工作家是如何开发复合写作的》(作者:Kaushik Viswanath) / AI 与我:本周的“AI 与我”揭示了 Katie 系统背后的故事和哲学。Natalia Quintero 就 Parrott 如何在 2023 年被裁员、负担不起职业教练时,用每月 20 美元的 ChatGPT 订阅一步步发展成“复合写作”对她进行了访谈。该指南解释了该方法的工作原理,而这段对话则展示了她为什么要构建它。 🎧 🖥 在 Spotify 或 Apple Podcasts 上收听,在 X 或 YouTube 上观看,或阅读文字记录。
《我们从 15 小时的 Anthropic 认证培训中学到了什么》(Natalia Quintero / Every):Every 团队中有三分之一的人参加了 Anthropic 推出的四个新课程认证——每门大约 10 到 15 小时——其重点不在于工作流,而在于词汇:技能的通用定义、MCP 以及 API,这是行业仍需达成共识的支架。作为一门“AI 101”,它很有效,尽管团队一致认为 Anthropic 的文档比视频写得更好。其中一门课程目前仍在使用在 API 中已不再提供的 Sonnet 模型。
《文件夹即智能体》(Kieran Klaassen / Source Code):在 Kieran 下周发表关于将人类与代码一同进行复合(compounding)的文章之前,我们重新发表了他 4 月份关于将文件夹视为智能体的文章。在追逐了三个月的智能体“蜂群”(swarms)之后,Kieran 意识到他可以将模型指向一个带有正确上下文、技能和 CLAUDE.md 的目录来获得一个专家。改变文件夹,你就会得到一个不同的专家。“你无法通过氛围来进行编排,”他发现——构建它、使用它、信任它,然后进行编排。
核心论点(Thesis Statements)
在《核心论点》(Thesis Statements)中阅读来自前沿人士的七个更多预测。这是一系列由构建者和思想家提出的、关于人类与 AI 共同进行伟大工作未来的具体、可争辩的主张。
我们的工作将是发现目的地,而不是优化路线 —— Christine Choi,M13 合伙人兼品牌传播负责人
艺术学校将是技术工作最好的训练 —— Hilary Gridley,产品leader兼《Writerbuilder》通讯作者
进步将以人类智慧的深度来衡量 —— Sam Pasupalak,Skyfall AI 联合创始人兼 CEO
AI 将成为思维的备料台(mise en place) —— Micah Rich,Every AI 教育负责人
机器将以我们彼此相遇的方式与我们相遇 —— Victor Riparbelli,Synthesia 联合创始人兼 CEO
你将为那些你能感受到却无法解释的东西获得报酬 —— Emmett Shine,Little Plains 联合创始人兼设计师
AI 将为卓越引入更低的下限和更高的上限 —— Ben Tossell,Ben’s Bites 创始人
欢迎参加我们于 2026 年 11 月 5 日举办的首届 Thesis: 2027 会议。
对齐研究(Alignment)
美丽的错误。 在一项关于 AI 用于药物发现的新研究中,研究人员要求模型根据分子的结构预测毒性等分子属性。随后,他们添加了 AI 生成的分子描述,以观察额外的上下文是否能改善预测。这些描述包含了明显的幻觉,然而一些模型在使用有缺陷的文本时,其表现甚至比仅使用分子结构时更好。
为什么错误的描述仍能带来有用的联系?研究人员认为,有缺陷的文本可能会促使模型考虑那些能引导其做出更好预测的反事实(counterfactuals)。不准确的描述可以为模型提供进入问题的新途径——就像用错钥匙却打开了对的门。
这个解释吸引我的地方在于它与创造性思维的相似之处:我们有时会遵循那些最终证明完全错误的思路,却引向了我们原本无法得出的富有成果的联系。
因此,在需要原创性的工作中,我们或许应该将幻觉视为待检验的假设,而不是应被驳回的错误。我的收获是:去追问一个错误的答案是否指向了一个有用的问题——然后去调查接下来会发生什么。——Ashwin Sharma