all articles
note · ZH

思维链提示激发大型语言模型的推理能力

Aug 4, 2026·84 min read·by Mr Panda·6 阅读

思维链提示激发大型语言模型的推理能力

中文译名: 思维链提示激发大型语言模型的推理能力
作者: Jason Wei、Xuezhi Wang、Dale Schuurmans、Maarten Bosma、Brian Ichter、Fei Xia、Ed H. Chi、Quoc V. Le、Denny Zhou
机构: Google Research, Brain Team
论文: arXiv:2201.11903v6,NeurIPS 2022
说明: 本文依据作者公开的 v6 版论文翻译。模型名、数据集名、数学符号与参考文献题名保留原文。

摘要

我们探讨了生成“思维链”(即一系列中间推理步骤)如何显著提升大型语言模型执行复杂推理的能力。具体而言,我们展示了一种名为“思维链提示”的简单方法:只需在提示中提供少量思维链演示作为示例,足够大的语言模型便会自然涌现出这种推理能力。

在三个大型语言模型上的实验表明,思维链提示能够改善模型在多种算术、常识和符号推理任务上的表现,提升幅度有时十分显著。例如,仅使用八个思维链示例提示 PaLM 540B,便在数学应用题基准 GSM8K 上取得了当时最佳准确率,甚至超过了配有验证器的微调版 GPT-3。

原论文图示

思维链提示使大型语言模型能够处理复杂的算术、常识和符号推理任务。强调了思维链推理过程。

图 2:GSM8K 上的解题率

1 引言

近年来,语言模型彻底改变了自然语言处理(NLP)领域(Peters 等人,2018;Devlin 等人,2019;Brown 等人,2020)。扩大语言模型规模能够带来多方面收益,例如提高性能和样本效率(Kaplan 等人,2020;Brown 等人,2020)。然而,单纯扩大模型规模仍不足以在算术、常识和符号推理等高难度任务上取得优异表现(Rae 等人,2021)。

本研究受两个思路启发,探索如何用一种简单方法释放大型语言模型的推理能力。第一,算术推理可以受益于生成通往最终答案的自然语言推理过程。以往研究或从头训练模型(Ling 等人,2017),或微调预训练模型(Cobbe 等人,2021),使模型能够生成自然语言中间步骤;另一些神经符号方法则以形式语言替代自然语言(Roy 和 Roth,2015;Chiang 和 Chen,2019;Amini 等人,2019;Chen 等人,2019)。第二,大型语言模型为通过提示实现上下文内少样本学习提供了可能。换言之,无须针对每项新任务分别微调模型检查点,只需向模型提供少量输入—输出示例来演示任务即可。这种方法已在多种简单问答任务上取得成功(Brown 等人,2020)。

不过,这两种思路都存在关键局限。对训练或微调数据增加推理依据,需要构建大量高质量的推理过程,其成本远高于普通机器学习所使用的简单输入—输出对。另一方面,Brown 等人(2020)采用的传统少样本提示在需要推理能力的任务上表现不佳,而且性能往往不会随模型规模增加而显著改善(Rae 等人,2021)。本文将二者的优势结合起来,同时避开各自的局限。具体而言,我们研究语言模型在推理任务上的少样本提示能力,提示中的每个示例都由三元组 $\langle$输入、思维链、输出$\rangle$ 构成。“思维链”是通往最终输出的一系列自然语言中间推理步骤,我们将这种方法称为“思维链提示”。图 1 给出了一个示例。

我们在算术、常识和符号推理基准上进行了实证评估。结果表明,思维链提示优于标准提示,有时优势十分显著。图 2 展示了其中一项结果:在数学应用题基准 GSM8K 上(Cobbe 等人,2021),PaLM 540B 的思维链提示远胜标准提示,并刷新了当时最佳成绩。纯提示方法的重要之处在于,它既不需要大型训练数据集,也允许同一个模型检查点完成多种任务而不损失通用性。本研究说明,大型语言模型能够通过少量包含任务信息的自然语言示例进行学习,而不必总是依靠大型训练集来自动归纳输入与输出之间的模式。

2 思维链提示

想想人类解决多步骤数学应用题等复杂推理任务时的思考过程。我们通常会把问题分解为若干中间步骤,逐步求解后再给出最终答案:“Jane 把 2 朵花送给妈妈后还剩 10 朵……再把 3 朵送给爸爸后还剩 7 朵……所以答案是 7。” 本文的目标,是让语言模型也能生成类似的“思维链”——一系列连贯的中间推理步骤,最终导向问题答案。我们将证明,只要在少样本提示示例中提供思维链推理演示,足够大的语言模型便可以生成思维链。

图 1 展示了一个例子:模型通过生成思维链,正确解答了一道在标准提示下会答错的数学应用题。这里的思维链很像一份解题过程,也可以这样理解;但我们仍称其为“思维链”,因为这个名称更能体现它对逐步得出答案这一思考过程的模拟。此外,通常意义上的“解答”或“解释”往往出现在最终答案之后(Narang 等人,2020;Wiegreffe 等人,2022;Lampinen 等人,2022)。

作为一种促进语言模型推理的方法,思维链提示具有以下几个优点。

  1. 原则上,思维链允许模型把多步骤问题分解为中间步骤,因此可以为需要更多推理步骤的问题分配更多计算。

  2. 思维链为理解模型行为提供了一个可解释窗口,揭示模型可能如何得出特定答案,也让人有机会定位推理路径中的错误(不过,要完整刻画支撑某个答案的模型内部计算,仍是一个开放问题)。

  3. 思维链推理可用于数学应用题、常识推理和符号操作等任务;至少原则上,它可能适用于任何人类能够借助语言解决的任务。

  4. 只需在少样本提示中加入思维链示例,就能从足够大的现成语言模型中直接引出思维链推理。

在实证实验中,我们将观察思维链提示对于算术推理(第 3 节)、常识推理(第 4 节)和符号推理的效用(第 5 节)。

3 算术推理

我们首先考察图 1 所示的数学应用题,以衡量语言模型的算术推理能力。此类推理对人类很简单,语言模型却经常难以应对(Hendrycks 等人,2021;Patel 等人,2021)。值得注意的是,将思维链提示用于 540B 参数模型时,其在多项任务上的表现可与针对特定任务微调的模型媲美,甚至在高难度 GSM8K 基准上刷新了当时最佳成绩(Cobbe 等人,2021)。

![原论文图示](https://course-media.xlearnity.ai/pandatalk/1785811600951-68d877af.png)

输入、思维链、输出的示例 用于算术、常识和符号推理基准的三元组。思维链被突出显示。 附录 G 中的完整提示。

实验设置

我们在多个基准上探索各种语言模型的思维链提示。

基准。 我们采用五个数学应用题基准:(1) GSM8K(Cobbe 等人,2021);(2) SVAMP,包含结构各异的数学应用题(Patel 等人,2021);(3) ASDiv,包含多样化的数学应用题(Miao 等人,2020);(4) AQuA,代数应用题数据集;以及 (5) MAWPS(Koncel-Kedziorski 等人,2016)。附录中的相应表格给出了问题示例。

标准提示。 基线采用 Brown 等人(2020)推广的标准少样本提示:先在上下文中向语言模型提供若干输入—输出示例,再让它预测测试样本。示例采用问答格式,模型直接给出答案,如图 1 左侧所示。

思维链提示。 我们的方法是在少样本提示的每个示例中,为答案增加一条思维链,如图 1 右侧所示。由于多数数据集只有评估集,我们手工编写了八个带思维链的少样本示例;完整内容见附录表 12。这些示例并未经过专门的提示工程,相关稳健性分析见第 3.4 节和附录 A.2。除采用多项选择题形式的 AQuA 外,我们在所有数学应用题基准上都使用同一组八个示例。AQuA 则使用训练集中的四个示例及其解答,见附录表 13。

语言模型。 我们评估了五类大型语言模型。第一类是 GPT-3(Brown 等人,2020),使用 text-ada-001、text-babbage-001、text-curie-001 和 text-davinci-002;它们大致对应参数量为 350M、1.3B、6.7B 和 175B 的 InstructGPT 模型(Ouyang 等人,2022)。第二类是 LaMDA(Thoppilan 等人,2022),参数量分别为 422M、2B、8B、68B 和 137B。第三类是 PaLM,参数量分别为 8B、62B 和 540B。第四类是 UL2 20B(Tay 等人,2022),第五类是 Codex(Chen 等人,2021)。模型均采用贪心解码;后续研究表明,对多次采样结果的最终答案进行多数投票还能进一步改善思维链提示(Wang 等人,2022a)。LaMDA 的结果取五个随机种子的平均值,每个种子使用不同的示例随机顺序。由于不同种子之间差异不大,为节省计算,其他模型只报告一种示例顺序的结果。

结果

图 4 汇总了思维链提示的最佳结果;不同模型系列、模型规模和基准上的完整结果见附录中的相应表格。结果有三个关键结论。第一,思维链提示是一种随模型规模涌现的能力(Wei 等人,2022b):它无法改善小模型的表现,只有在约 100B 参数量级的模型上才开始产生收益。定性观察表明,小模型生成的思维链虽然流畅,却不合逻辑,因此表现反而低于标准提示。

原论文图示

其次,思维链提示对于更复杂的问题有更大的性能提升。例如,对于 GSM8K(基线性能最低的数据集),最大的 GPT 和 PaLM 模型的性能增加了一倍多。另一方面,对于 SingleOp(MAWPS 的最简单子集),只需要一步即可求解,性能改进要么是负的,要么非常小(参见附录 相应表格)。

第三,GPT-3 175B 和 PaLM 540B 的思维链提示结果可与此前最佳方法相媲美,而后者通常需要在带标注训练集上微调任务专用模型。如图 4 所示,PaLM 540B 借助思维链提示在 GSM8K、SVAMP 和 MAWPS 上刷新了当时最佳成绩(不过在 SVAMP 上,标准提示本身已经超过此前最佳结果)。在 AQuA 和 ASDiv 上,其结果与当时最佳成绩相差不到 2%(见附录中的相应表格)。

为了更好地理解为什么思维链提示有效,我们手动检查了 LaMDA 137B 为 GSM8K 模型生成的思维链。在模型返回正确最终答案的 50 随机示例中,除了两个巧合地得出正确答案之外,所有生成的思维链在逻辑和数学上都是正确的(有关正确答案的示例,请参阅 附录 D.1 和 1)模型生成的思维链)。我们还随机检查了模型给出错误答案的 50 随机样本。这一分析的总结是,除了一些小错误(计算器错误、符号映射错误或缺少一个推理步骤)之外,思维链中的46%几乎是正确的,而思维链中的另一54%在语义理解或连贯性方面存在重大错误(参见附录 D.2)。为了深入了解为什么缩放可以提高思维链推理能力,我们对 PaLM 62B 所犯的错误进行了类似的分析,以及这些错误是否通过缩放到 PaLM 540B 来修复。总结是,将 PaLM 缩放到 540B 修复了 62B 模型中的一大部分一步缺失和语义理解错误(请参阅 附录 A.1)。

消融研究

使用思维链提示所观察到的好处自然引发了一个问题:是否可以通过其他类型的提示来实现相同的性能改进。 图 5 显示了一种消融研究,其思维链的三种变化如下所述。

仅方程式。 思维链提示可能有帮助的一个原因是它会生成要评估的数学方程式,因此我们测试了一种变体,其中提示模型在给出答案之前仅输出数学方程式。 图 5表明,仅方程提示对GSM8K没有太大帮助,这意味着GSM8K中问题的语义太具有挑战性,无法在没有思维链中的自然语言推理步骤的情况下直接翻译成方程。然而,对于一步或两步问题的数据集,我们发现仅提示方程确实可以提高性能,因为方程可以很容易地从问题中导出(参见附录 相应表格)。

原论文图示

**仅变量计算。**另一个直觉是思维链允许模型在更困难的问题上花费更多的计算(即中间标记)。为了将变量计算的影响与思维链推理隔离开来,我们测试了一种配置,其中提示模型输出唯一的点序列 ($\ldots$),该序列等于解决问题所需的方程中的字符数。这个变体的表现与基线大致相同,这表明变量计算本身并不是思维链提示成功的原因,并且通过自然语言表达中间步骤似乎是有用的。

回答后的思维链。 思维链提示的另一个潜在好处可能只是这样的提示允许模型更好地访问在预训练期间获得的相关知识。因此,我们测试了另一种配置,其中仅在答案之后给出思维链提示,从而隔离模型是否实际上依赖于产生的思维链来给出最终答案。该变体的表现与基线大致相同,这表明思维链中体现的顺序推理除了激活知识之外还有其他用途。

思维链的稳健性

图 6:思维链提示对不同示例与标注者的稳健性

对样本的敏感性是提示方法的一个关键考虑因素,例如,改变少样本样本的排列可能会导致 SST-2 上的 GPT-3 的准确性范围从近乎偶然 (54.3%) 到近乎最先进的 (93.4%)(Zhao 等人,2021)。在最后一小节中,我们评估不同标注者编写的思维链的稳健性。除了上面使用标注者 A 编写的思维链的结果之外,本文的另外两位合著者(标注者 B 和 C)独立为相同的少样本样本编写了思维链(如 附录 H 所示)。标注者 A 还遵循 Cobbe 等人给出的解决方案风格,写了另一条比原来更简洁的思维链。 (2021).[^1]

图 6 显示了 LaMDA 137B 在 GSM8K 和 MAWPS 上的结果(其他数据集的消融结果在附录中给出) 相应表格 / 相应表格)。尽管不同的思维链标注之间存在差异,正如使用基于范例的提示时所预期的那样(Le Scao 和 Rush,2021;Reynolds 和 McDonell,2021;Zhao 等人,2021),但所有思维链提示集都大幅优于标准基线。这一结果意味着思维链的成功使用并不依赖于特定的语言风格。

为了确认成功的思维链提示适用于其他样本集,我们还对从 GSM8K 训练集(一个独立来源)中随机采样的三组八个样本进行实验(该数据集中的示例已经包括像思维链这样的推理步骤)。[^2] 图 6 表明这些提示的执行效果与我们手动编写的示例相当,也大大优于标准提示。

除了对标注者、独立编写的思维链、不同范例和各种语言模型的鲁棒性之外,我们还发现算术推理的思维链提示对不同范例顺序和不同数量的范例具有鲁棒性(参见附录 A.2)。

4 常识推理

思维链尤其适合数学应用题,但其语言化特征也使它能够应用于广泛的常识推理问题。这类问题需要以一般背景知识为基础,对物理世界和人类互动进行推理。常识推理是智能体与世界互动的关键能力,却仍超出当前自然语言理解系统的能力范围(Talmor 等人,2021)。

基准。 我们选用五个数据集,覆盖多种常识推理类型。CSQA(Talmor 等人,2019)包含语义复杂、通常需要先验知识的常识问题。StrategyQA(Geva 等人,2021)要求模型推断多跳策略来回答问题。我们还从 BIG-bench(BIG-bench collaboration,2021)中选取两个专门评估集:日期理解要求从给定上下文推断日期,体育理解要求判断体育相关句子是否合理。最后,SayCan(Ahn 等人,2022)要求把自然语言指令映射为离散机器人动作序列。图 3 展示了这些数据集及其思维链标注示例。

提示。 实验设置与上一节相同。对于 CSQA 和 StrategyQA,我们从训练集中随机选择示例,并手工编写思维链,作为少样本提示。两个 BIG-bench 任务没有训练集,因此使用评估集的前十个示例作为少样本示例,并在其余评估样本上报告结果。对于 SayCan,我们采用 Ahn 等人(2022)训练集中的六个示例,并同样手工编写思维链。

结果。 图 7 给出了 PaLM 的主要结果;LaMDA、GPT-3 及不同模型规模的完整结果见相应表格。在所有任务上,扩大模型规模都提高了标准提示的表现,而思维链提示又带来了进一步收益,其中 PaLM 540B 的提升最大。借助思维链提示,PaLM 540B 在 StrategyQA 上超过此前最佳结果(75.6% 对 69.4%),在体育理解任务上也超过未借助工具的体育爱好者(95.4% 对 84%)。这些结果说明,思维链提示同样能够改善多种常识推理任务的表现,不过在 CSQA 上收益很小。

原论文图示

思维链提示还提高了语言模型的常识推理能力。此处显示的语言模型是 PaLM。之前的最佳数字来自 CSQA(Talmor 等人,2019)和 StrategyQA(Geva 等人,2021)的排行榜(仅限单一模型,截至 5 月 5, 2022)。使用不同尺寸的 LaMDA、GPT-3 和 PaLM 的其他结果显示在 相应表格 中。

原论文图示

5 符号推理

最后一组实验考察符号推理。此类任务对人类很简单,对语言模型却可能颇具挑战。结果表明,思维链提示不仅使语言模型能够完成标准提示下难以解决的符号推理任务,还能促进长度泛化,使模型处理比少样本示例更长的推理时输入。

任务

我们使用以下两个玩具任务。

  • 末字母拼接。 该任务要求模型拼接姓名中每个单词的最后一个字母(例如,“Amy Brown” $\rightarrow$ “yn”)。它比首字母拼接更难;语言模型即使没有思维链也已能完成后者。[^3] 我们从姓名统计数据(https://namecensus.com/)中最常见的一千个名字和姓氏里随机组合出完整姓名。

  • 抛硬币。 该任务要求模型判断:若若干人分别翻转或不翻转一枚硬币,最后硬币是否仍正面朝上(例如,“一枚硬币正面朝上。Phoebe 翻转了硬币。Osvaldo 没有翻转硬币。硬币仍正面朝上吗?” $\rightarrow$ “否”)。

由于这些符号推理任务的构造是明确定义的,因此对于每个任务,我们考虑一个“域内”测试集,其中示例的步骤数与训练/少样本示例相同,以及一个“域外”(OOD)测试集,其中评估示例的步骤数多于示例中的步骤。对于最后一个字母串联,模型仅看到包含两个单词的姓名范例,然后对包含 3 和 4 单词的姓名执行最后一个字母串联。[^4] 我们对硬币翻转任务中潜在的翻转次数执行相同的操作。我们的实验设置使用与前两节相同的方法和模型。我们再次为每个任务的少样本手动构建思维链,这些样本在 图 3 中给出。

结果

PaLM 的域内和 OOD 结果见图 8,LaMDA 的结果见附录中的相应表格。在 PaLM 540B 上,思维链提示的解题率接近 100%(标准提示在 PaLM 540B 上也能解决抛硬币任务,但在 LaMDA 137B 上不能)。这些域内评估可视为“玩具任务”:少样本示例中的思维链已经给出完整的解题结构,模型只需在测试样本中对新符号重复相同步骤。即便如此,小模型仍然失败——在这些任务上对未见符号执行抽象操作的能力,要到约 100B 参数规模才会涌现。

在 OOD 评估中,标准提示在两项任务上都失败了;采用思维链提示后,性能随模型规模上升,尽管仍低于域内设置。因此,对于规模足够大的语言模型,思维链提示能够促进超出已见思维链长度的泛化。

6 讨论

我们探索了思维链提示作为在大型语言模型中引发多步骤推理行为的简单机制。我们首先看到思维链提示大大提高了算术推理的性能,产生的改进比消融强得多,并且对不同的标注者、范例和语言模型具有鲁棒性(第 3 节)。接下来,常识推理实验强调了思维链推理的语言性质如何使其普遍适用(第 4 节)。最后,我们表明,对于符号推理,思维链提示有助于 OOD 泛化到更长的序列长度(第 5 节)。在所有实验中,思维链推理都是通过提示现成的语言模型来引发的。在撰写本文的过程中没有对任何语言模型进行微调。

由于模型规模而出现的思维链推理一直是一个流行的主题(Wei 等人,2022b)。对于许多推理任务,标准提示具有平坦的缩放曲线,思维链提示会导致缩放曲线显著增加。思维链提示似乎扩展了大型语言模型可以成功执行的任务集,换句话说,我们的工作强调标准提示仅提供大型语言模型功能的下限。这一观察可能提出的问题多于它给出的答案,例如,随着模型规模的进一步增加,我们可以期望推理能力提高多少?还有哪些其他提示方法可以扩大语言模型可以解决的任务范围?

至于局限性,我们首先限定,虽然思维链模拟了人类推理者的思维过程,但这并不能回答神经网络是否真的在“推理”,我们将其作为一个悬而未决的问题。其次,尽管在少样本设置中用思维链手动增强样本的成本是最小的,但这种标注成本对于微调来说可能会令人望而却步(尽管这可能可以通过合成数据生成或零样本泛化来克服)。第三,无法保证正确的推理路径,这可能会导致正确答案和错误答案;改进语言模型的事实生成是未来工作的一个开放方向(Rashkin 等人,2021;Ye 和 Durrett,2022;Wiegreffe 等人,2022)。最后,思维链推理仅在大型模型规模上出现,这使得在现实世界的应用中提供服务的成本高昂;进一步的研究可以探索如何在较小的模型中引发推理。

7 相关工作

这项工作受到许多研究领域的启发,我们在扩展的相关工作部分 (附录 C) 中详细介绍了这些领域。在这里,我们描述了两个可能最相关的方向和相关论文。

第一个相关方向,是利用中间步骤解决推理问题。Ling 等人(2017)率先提出用自然语言推理依据和一系列中间步骤来求解数学应用题,这与使用形式语言进行推理的研究形成鲜明对照(Roy 等人,2015;Chiang 和 Chen,2019;Amini 等人,2019;Chen 等人,2019)。Cobbe 等人(2021)进一步构建了更大的数据集,并用它微调预训练语言模型,而不是从头训练。在程序综合领域,Nye 等人(2021)让语言模型逐行预测中间计算结果,再预测 Python 程序的最终输出,并表明这种逐步预测优于直接预测最终输出。

本文也与近期大量提示研究密切相关。Brown 等人(2020)推广少样本提示后,研究者提出了多种通用改进方法,例如自动学习提示(Lester 等人,2021),或向模型提供任务说明(Wei 等人,2022a;Sanh 等人,2022;Ouyang 等人,2022)。这些方法主要改进或增强提示的输入部分,例如在输入前添加指令;我们的工作则沿着与之正交的方向,用思维链增强语言模型的输出。

8 结论

我们探索了思维链提示作为一种简单且广泛适用的增强语言模型推理的方法。通过算术、符号和常识推理的实验,我们发现思维链推理是模型规模的一个新兴属性,它允许足够大的语言模型执行原本具有平坦缩放曲线的推理任务。扩大语言模型可以执行的推理任务范围有望激发基于语言的推理方法的进一步研究。

致谢

我们感谢 Jacob Devlin、Claire Cui、Andrew Dai 和 Ellie Pavlick 对本文提供的反馈。我们感谢 Jacob Austin、Yuhuai Wu、Henryk Michalewski、Aitor Lewkowycz、Charles Sutton 和 Aakanksha Chowdhery 进行了有益的讨论。我们感谢 Sid Maxwell 通知我们原稿中手动错误分析中的错误。

参考文献

NeurIPS 论文检查表

  1. 适用于所有作者

    • 摘要和引言中的主要主张是否准确反映论文的贡献与范围?是。
    • 是否描述了工作的局限性?**是。**见第 6 节和附录 A.2。
    • 是否讨论了潜在的负面社会影响?**是。**作者预计本文贡献本身不会直接造成负面社会影响,但提醒读者:模型生成的思维链并不总是符合事实,不应在事实性或真实世界场景中直接使用。
    • 是否阅读并遵守伦理审查指南?是。
  2. 如果包含理论结果

    • 是否陈述全部假设并提供完整证明?不适用。
  3. 如果开展了实验

    • 是否提供复现主要结果所需的代码、数据与说明?**是。**补充材料包含 LaMDA 和 GPT-3 的输入、输出与目标;GPT-3 结果可复现,更多说明见附录 E.1。
    • 是否说明训练细节?**是。**文中给出了数据划分;超参数不适用。
    • 是否报告误差线?**是。**表 6 和表 7 给出了 LaMDA 137B 在不同示例顺序随机种子下的标准差。
    • 是否说明计算资源?**是。**资源类型见附录 E.2,但作者未估算总计算量。
  4. 如果使用现有资产或发布新资产

    • 是否引用资产创建者、说明许可证并提供新资产?**是。**详情见附录 E.3;新资产为抛硬币与末字母拼接数据集,收录于补充材料。
    • 是否涉及个人同意、个人身份信息或冒犯性内容?**不适用。**未收集人类数据。
  5. 如果使用众包或开展人类受试者研究

    • 参与者说明、潜在风险和报酬信息是否完整?不适用。

附录 A:常见问题解答

为什么增加模型规模可以改善思维链提示?

成功的思维链推理仅在某些模型规模下才会出现,这一发现很有趣。扩大语言模型已被证明可以带来诸如提高性能和样本效率等好处(Kaplan 等人,2020),但思维链推理正在兴起,因为它的成功不能仅通过推断小规模模型的性能来预测,因为思维链实际上会损害大多数小于 10B 参数的模型的性能。

模型规模为何能提高思维链提示的问题当然是多方面的,我们初步尝试通过误差分析来深入了解它。这个小分析涉及手动读取 PaLM 62B 产生的 45 错误,并将其分类为语义理解(20 错误)、一步缺失(18 错误)和其他错误(7 错误)。 “其他类别”包括幻觉、重复输出和符号映射错误。这种分类是从 附录 D.2 中对 LaMDA 进行的初始错误分析中借用的粗略分类,其类别是根据需要改进以使思维链正确而构思的。

如 图 9 所示,将 PaLM 缩放到 540B 参数修复了所有三个类别中的大部分错误。 图 10 中给出了通过将 PaLM 缩放到 540B 修复的语义理解和一步缺失错误的示例。这一结果似乎与以下假设一致:语言模型获得一系列语义理解和逻辑推理技能,作为模型规模的函数(尽管请注意,模型规模通常与其他因素(例如训练计算量)混为一谈)。

![原论文图示](https://course-media.xlearnity.ai/pandatalk/1785811620159-bcdc05c0.png)
45 PaLM 62B 出错的问题的错误分析。这些错误被分类为语义理解、缺少一步等。另一类包括幻觉、重复输出和符号映射错误。将 PaLM 缩放到 540B 修复了所有类别中的大部分错误。

关于小语言模型失败的原因,还有三个值得注意的点。第一个观察结果是,小型语言模型甚至无法完成相对简单的符号映射任务。正如 第 5 节 中所演示的,即使是仅需要使用与少样本中给出的相同思维链逻辑结构泛化到新示例的符号推理任务,小型语言模型仍然会失败。第二个观察结果是,小型语言模型似乎天生具有较弱的算术能力,如(Brown et al., 2020)所示,进行简单算术运算(无需语义理解)的能力需要足够的模型规模。最后,我们定性地注意到,由于重复或逻辑从未得出最终答案,小型语言模型通常不会生成可解析的最终答案。

总之,模型规模导致的思维链推理的成功是一个复杂的现象,可能涉及各种新兴能力(语义理解、符号映射、紧扣主题、算术能力、忠实度等)。未来的工作可以更彻底地研究预训练数据、模型架构和优化目标的哪些属性导致了这种推理能力。

![原论文图示](https://course-media.xlearnity.ai/pandatalk/1785811632305-ee2f2247.png)
语义理解和一步缺失错误的示例,通过将 PaLM 从 62B 缩放到 540B 来修复。

提示工程的作用是什么?

提示的关键考虑因素之一是对确切提示的敏感性。不乏研究表明提示会以意想不到的方式影响语言模型(Min 等人,2022)。我们创建思想标注链的一般方法是从训练集中选取八个样本,并将推理过程分解为多个步骤,从而得出最终答案。 图 3 中提供了思维链标注的示例,附录 G 中给出了完整的提示。为了分析思维链对促进工程的敏感程度,我们针对各种因素进行了稳健性实验。

  • **不同的标注者。**我们首先分析三种不同标注者的鲁棒性(第 3.4 节 和 图 6)。尽管性能存在显著差异(我们将在稍后讨论),但对于算术、常识和符号推理(相应表格相应表格)。类似于 Cobbe 等人的标注过程。 (2021),标注者没有得到关于如何编写思维链标注的具体说明,而只是简单地编写导致最终答案的逐步推理过程。因此,标注是用每个标注者自己的语言“思维链”写作风格来写的。

  • 没有机器学习背景的标注者。 GSM8K 数据集(Cobbe 等人,2021)方便地提供了由人群计算工作者编写的思维链训练集,这使我们能够研究思维链是否仍然可以与来自独立来源的思维链一起使用,而无需机器学习背景。因此,我们从GSM8K中随机抽取了三组八个具有思维链的范例。对于所有四个算术数据集(相应表格),这些思维链标注也大大优于基线,这表明思维链不依赖于特定的标注者集。

  • 不同的范例。 上面的不同 GSM8K 范例实验(相应表格)也表明思维链提示适用于不同的范例集。值得注意的是,我们在所有四个算术数据集上测试每组样本(而不是从每个数据集的训练集中挑选样本),这表明样本不一定必须来自与测试示例相同的数据集分布。

  • **样本的不同顺序。**先前的工作表明,在某些情况下(例如分类),即使提示的顺序也很重要——改变少样本样本的排列可能会导致 GPT-3 在 SST-2 上的准确性从接近机会 (54.3%) 到接近 SOTA (93.4%)(Zhao 等人,2021)。我们在 相应表格相应表格 中显示了不同示例的性能标准偏差。几乎在所有情况下,示例顺序的标准偏差都相对较小。一个例外是抛硬币任务,该任务的样本订单具有很高的标准差,这可能是Zhao等人引用的原因。 (2021)—对于分类,同一类别的许多连续样本会使模型输出产生偏差)。

  • **不同数量的样本。**我们还发现,当存在不同数量的少样本样本时,思维链提示的收益通常仍然存在。这是针对 图 11 中的五个数据集显示的(我们没有计算能力对所有数据集运行此操作)。我们在初步实验中还发现,进一步增加标准提示中的范例数量并没有带来显著的收益(例如,从 8 增加到 16 范例并没有提高标准提示的性能足以赶上思维链提示)。

  • **不同的语言模型。**另一个有趣的问题是,对于一种模型更有效的某些提示是否也更适合其他大型语言模型。我们发现,使用相同的提示,思维链提示可以提高所有数据集的所有三个模型(LaMDA、GPT-3 和 PaLM)的性能,但 GPT-3 的 CSQA 和 StrategyQA 除外(相应表格相应表格相应表格)。事实上,思维链的收益不能在模型之间完美转移,这是一个限制;进一步的工作可以研究为什么不同的预训练数据集和模型架构如何影响思维链提示的性能增益。

尽管如此,提示工程仍然很重要。 尽管结果对于算术推理的提示来说相对稳健,但我们希望清楚的是,提示工程仍然很重要,并且在许多情况下可以显著提高性能。尽管大多数思维链标注的效果优于标准提示,但在许多情况下存在很大差异。例如,对于抛硬币任务,性能从标注者 A 的 99.6% 到标注者 C 的 71.4% 不等,尽管两者都高于标准提示的 50.0%(请参阅 相应表格)。甚至有些任务需要提示工程才能获得良好的性能。在初步实验中,我们尝试使用思维链使语言模型能够反转 5 项目列表的顺序。尽管两位合著者尽了最大努力,但仍无法写出解决任务的思维链提示,而第三位合著者却能够写出完美解决任务的思维链。

如何以稳健的方式生成思想标注链可能是未来工作的一个有趣方向。例如,这里的一个想法可能是使用大型语言模型通过提示自动生成思维链(并可能在验证集上对其进行优化)。

思维链提示会提高我感兴趣的任务的性能吗?

虽然思维链提示原则上适用于任何文本到文本的任务,但它对某些任务比其他任务更有帮助。根据本文的实验,我们的直觉是,当满足三个条件时,思维链最有帮助:(1)任务具有挑战性并且需要多步骤推理,(2)使用大型语言模型,以及(3)缩放曲线相对平坦。相反,当这些条件中的一个或多个条件不满足时,收益就会较小。

这些直觉也许得到了算术推理结果的支持。 PaLM 540B 在 GSM8K 上的思维链提示的性能增益最大(具有挑战性的多步骤问题,平坦的缩放曲线),满足这些条件。对于仅需要一两个步骤的 MAWPS 子集(SingleOP、SingleEq 和 AddSub)来说,性能增益很小,其中 PaLM 540B 已经实现了 90% 或更高的性能(而且通常情况下,当性能已经达到一定水平时,改进的余地较小)强)。

尽管在本文中我们关注的是多步骤推理任务(算术、常识和符号),但思维链提示可以应用于人类使用“思维链”来解决的任何任务(至少在原则上)。我们将对此类不同任务(例如机器翻译等)的思维链提示的实证评估留给未来的工作。

为什么仅用方程提示对于某些算术推理数据集来说还不够?

仅将方程作为中间步骤进行提示确实对许多数据集有帮助,特别是当数据集仅需要几个推理步骤(SVAMP、ASDiv、MAWPS)时。然而,对于 GSM8K,仅使用该方程并不能显著提高性能。基于定性分析,我们认为这些问题在语义上对于模型来说太具有挑战性,无法将它们直接转化为数学方程。考虑 LaMDA 137B 中的示例:

问题: 迈克打乒乓球时间为 40 分钟。在第一个 20 分钟内,他获得了 4 分。在第二分钟20,他获得了更多分数。他总共得了多少分?

(4 + 20 * 0.25) = 6. 答案是 6.

迈克打乒乓球时间为 40 分钟。在第一个20分钟内,他获得了4分。在第二分钟20,他获得了更多分数。所以他在第二分钟20得分更多。 4 x 1.25 = 5. 因此,他在第二个 20 分钟内获得了 5 分。所以他的总分是9。答案是9.

该模型很难将所有语义直接转换为单个方程,但思维链允许它通过自然语言的中间步骤更好地推理问题的每个部分。

附录 B:所有实验结果

本部分包含不同模型和模型大小、所有基准、标准提示与思维链提示的实验结果表。

对于算术推理基准,一些思维链(以及生成的方程)是正确的,只是模型执行的算术运算不正确。 Cobbe 等人也进行了类似的观察。 (2021)。因此,我们可以进一步将Python程序作为外部计算器(使用Python eval函数)添加到生成的思维链中的所有方程中。当思维链中有多个方程时,我们通过字符串匹配将外部计算器结果从一个方程传播到后面的方程。如 相应表格 所示,我们发现添加计算器可以显著提高大多数任务的思维链提示性能。

提示 GSM8K SVAMP ASDiv AQuA MAWPS
先前最佳 不适用(微调) 55$^a$ 57.4$^b$ 75.3$^c$ 37.9$^d$ 88.4$^e$
UL2 20B 标准 4.1 10.1 16.0 20.5 16.6
思维链 4.4 (+0.3) 12.5 (+2.4) 16.9 (+0.9) 23.6 (+3.1) 19.1 (+2.5)
+ 外部计算器 6.9 28.3 34.3 23.6 42.7
LaMDA 137B 标准 6.5 29.5 40.1 25.5 43.2
思维链 14.3 (+7.8) 37.5 (+8.0) 46.6 (+6.5) 20.6 (-4.9) 57.9 (+14.7)
+ 外部计算器 17.8 42.1 53.4 20.6 69.3
GPT-3 175B 标准 15.6 65.7 70.3 24.8 72.7
(text-davinci-002) 思维链 46.9 (+31.3) 68.9 (+3.2) 71.3 (+1.0) 35.8 (+11.0) 87.1 (+14.4)
+ 外部计算器 49.6 70.3 71.1 35.8 87.5
Codex 标准 19.7 69.9 74.0 29.5 78.7
(code-davinci-002) 思维链 63.1 (+43.4) 76.4 (+6.5) 80.4 (+6.4) 45.3 (+15.8) 92.6 (+13.9)
+ 外部计算器 65.4 77.0 80.0 45.3 93.3
PaLM 540B 标准 17.9 69.4 72.1 25.2 79.2
思维链 56.9 (+39.0) 79.0 (+9.6) 73.9 (+1.8) 35.8 (+10.6) 93.3 (+14.2)
+ 外部计算器 58.6 79.8 72.6 35.8 93.5

GSM8K SVAMP ASDiv AQuA MAWPS
模型 标准 CoT 标准 CoT 标准 CoT 标准 CoT 标准 CoT
UL2 20B 4.1 4.4 10.1 12.5 16.0 16.9 20.5 23.6 16.6 19.1
LaMDA 420M 2.6 0.4 2.5 1.6 3.2 0.8 23.5 8.3 3.2 0.9
2B 3.6 1.9 3.3 2.4 4.1 3.8 22.9 17.7 3.9 3.1
8B 3.2 1.6 4.3 3.4 5.9 5.0 22.8 18.6 5.3 4.8
68B 5.7 8.2 13.6 18.8 21.8 23.1 22.3 20.2 21.6 30.6
137B 6.5 14.3 29.5 37.5 40.1 46.6 25.5 20.6 43.2 57.9
GPT 350M 2.2 0.5 1.4 0.8 2.1 0.8 18.1 8.7 2.4 1.1
1.3B 2.4 0.5 1.5 1.7 2.6 1.4 12.6 4.3 3.1 1.7
6.7B 4.0 2.4 6.1 3.1 8.6 3.6 15.4 13.4 8.8 3.5
175B 15.6 46.9 65.7 68.9 70.3 71.3 24.8 35.8 72.7 87.1
Codex - 19.7 63.1 69.9 76.4 74.0 80.4 29.5 45.3 78.7 92.6
PaLM 8B 4.9 4.1 15.1 16.8 23.7 25.2 19.3 21.7 26.2 30.5
62B 9.6 29.9 48.2 46.7 58.7 61.9 25.6 22.4 61.8 80.3
540B 17.9 56.9 69.4 79.0 72.1 73.9 25.2 35.8 79.2 93.3

SingleOp SingleEq AddSub MultiArith
模型 标准 CoT 标准 CoT 标准 CoT 标准 CoT
UL2 20B 24.9 27.2 18.0 20.2 18.5 18.2 5.0 10.7
LaMDA 420M 2.8 1.0 2.4 0.4 1.9 0.7 5.8 1.5
2B 4.6 4.1 2.4 3.3 2.7 3.2 5.8 1.8
8B 8.0 7.0 4.5 4.4 3.4 5.2 5.2 2.4
68B 36.5 40.8 23.9 26.0 17.3 23.2 8.7 32.4
137B 73.2 76.2 48.8 58.7 43.0 51.9 7.6 44.9
GPT 350M 3.2 1.8 2.0 0.2 2.0 1.5 2.3 0.8
1.3B 5.3 3.0 2.4 1.6 2.3 1.5 2.2 0.5
6.7B 13.5 3.9 8.7 4.9 8.6 2.5 4.5 2.8
175B 90.9 88.8 82.7 86.6 83.3 81.3 33.8 91.7
Codex - 93.1 91.8 86.8 93.1 90.9 89.1 44.0 96.2
PaLM 8B 41.8 46.6 29.5 28.2 29.4 31.4 4.2 15.8
62B 87.9 85.6 77.2 83.5 74.7 78.2 7.3 73.7
540B 94.1 94.1 86.5 92.3 93.9 91.9 42.2 94.7

CSQA StrategyQA 日期 体育 SayCan
模型 标准 CoT 标准 CoT 标准 CoT 标准 CoT 标准 CoT
UL2 20B 34.2 51.4 59.0 53.3 13.5 14.0 57.9 65.3 20.0 41.7
LaMDA 420M 20.1 19.2 46.4 24.9 1.9 1.6 50.0 49.7 7.5 7.5
2B 20.2 19.6 52.6 45.2 8.0 6.8 49.3 57.5 8.3 8.3
8B 19.0 20.3 54.1 46.8 9.5 5.4 50.0 52.1 28.3 33.3
68B 37.0 44.1 59.6 62.2 15.5 18.6 55.2 77.5 35.0 42.5
137B 53.6 57.9 62.4 65.4 21.5 26.8 59.5 85.8 43.3 46.6
GPT 350M 14.7 15.2 20.6 0.9 4.3 0.9 33.8 41.6 12.5 0.8
1.3B 12.0 19.2 45.8 35.7 4.0 1.4 0.0 26.9 20.8 9.2
6.7B 19.0 24.0 53.6 50.0 8.9 4.9 0.0 4.4 17.5 35.0
175B 79.5 73.5 65.9 65.4 43.8 52.1 69.6 82.4 81.7 87.5
Codex - 82.3 77.9 67.1 73.2 49.0 64.8 71.7 98.5 85.8 88.3
PaLM 8B 19.8 24.9 55.6 53.5 12.9 13.1 55.1 75.2 34.2 40.0
62B 65.4 68.1 58.4 63.4 29.8 44.7 72.1 93.6 65.8 70.0
540B 78.1 79.9 68.6 77.8 49.0 65.3 80.5 95.4 80.8 91.7

最后一个字母串联 硬币翻转(状态跟踪)
步数 2 OOD: 3 OOD: 4 2 OOD: 3 OOD: 4
模型 标准 CoT 标准 CoT 标准 CoT 标准 CoT 标准 CoT 标准 CoT
UL2 20B 0.6 18.8 0.0 0.2 0.0 0.0 70.4 67.1 51.6 52.2 48.7 50.4
LaMDA 420M 0.3 1.6 0.0 0.0 0.0 0.0 52.9 49.6 50.0 50.5 49.5 49.1
2B 2.3 6.0 0.0 0.0 0.0 0.0 54.9 55.3 47.4 48.7 49.8 50.2
8B 1.5 11.5 0.0 0.0 0.0 0.0 52.9 55.5 48.2 49.6 51.2 50.6
68B 4.4 52.0 0.0 0.8 0.0 2.5 56.2 83.2 50.4 69.1 50.9 59.6
137B 5.8 77.5 0.0 34.4 0.0 13.5 49.0 99.6 50.7 91.0 49.1 74.5
PaLM 8B 2.6 18.8 0.0 0.0 0.0 0.2 60.0 74.4 47.3 57.1 50.9 51.8
62B 6.8 85.0 0.0 59.6 0.0 13.4 91.4 96.8 43.9 91.0 38.3 72.4
540B 7.6 99.4 0.2 94.8 0.0 63.0 98.1 100.0 49.3 98.6 54.8 90.2

GSM8K SVAMP ASDiv MAWPS
标准提示 6.5 $\pm$ 0.4 29.5 $\pm$ 0.6 40.1 $\pm$ 0.6 43.2 $\pm$ 0.9
思维链提示 14.3 $\pm$ 0.4 36.7 $\pm$ 0.4 46.6 $\pm$ 0.7 57.9 $\pm$ 1.5
消融
仅 $\cdot$ 方程 5.4 $\pm$ 0.2 35.1 $\pm$ 0.4 45.9 $\pm$ 0.6 50.1 $\pm$ 1.0
$\cdot$ 仅限变量计算 6.4 $\pm$ 0.3 28.0 $\pm$ 0.6 39.4 $\pm$ 0.4 41.3 $\pm$ 1.1
$\cdot$ 答案后推理 6.1 $\pm$ 0.4 30.7 $\pm$ 0.9 38.6 $\pm$ 0.6 43.6 $\pm$ 1.0
稳健性
$\cdot$ 不同的标注者(B) 15.5 $\pm$ 0.6 35.2 $\pm$ 0.4 46.5 $\pm$ 0.4 58.2 $\pm$ 1.0
$\cdot$ 不同的标注者 (C) 17.6 $\pm$ 1.0 37.5 $\pm$ 2.0 48.7 $\pm$ 0.7 60.1 $\pm$ 2.0
$\cdot$ 刻意简洁的风格 11.1 $\pm$ 0.3 38.7 $\pm$ 0.8 48.0 $\pm$ 0.3 59.6 $\pm$ 0.7
$\cdot$ 示例来自 GSM8K ($\alpha$) 12.6 $\pm$ 0.6 32.8 $\pm$ 1.1 44.1 $\pm$ 0.9 53.9 $\pm$ 1.1
$\cdot$ 示例来自 GSM8K ($\beta$) 12.7 $\pm$ 0.5 34.8 $\pm$ 1.1 46.9 $\pm$ 0.6 60.9 $\pm$ 0.8
$\cdot$ 示例来自 GSM8K ($\gamma$) 12.6 $\pm$ 0.7 35.6 $\pm$ 0.5 44.4 $\pm$ 2.6 54.2 $\pm$ 4.7

常识 符号推理
任务 日期 体育 SayCan 末字母拼接 硬币
标准提示 21.5 $\pm$ 0.6 59.5 $\pm$ 3.0 80.8 $\pm$ 1.8 5.8 $\pm$ 0.6 49.0 $\pm$ 2.1
思维链提示 26.8 $\pm$ 2.1 85.8 $\pm$ 1.8 91.7 $\pm$ 1.4 77.5 $\pm$ 3.8 99.6 $\pm$ 0.3
消融
$\cdot$ 仅限变量计算 21.3 $\pm$ 0.7 61.6 $\pm$ 2.2 74.2 $\pm$ 2.3 7.2 $\pm$ 1.6 50.7 $\pm$ 0.7
$\cdot$ 答案后推理 20.9 $\pm$ 1.0 63.0 $\pm$ 2.0 83.3 $\pm$ 0.6 0.0 $\pm$ 0.0 50.2 $\pm$ 0.5
稳健性
$\cdot$ 不同的标注者(B) 27.4 $\pm$ 1.7 75.4 $\pm$ 2.7 88.3 $\pm$ 1.4 76.0 $\pm$ 1.9 77.5 $\pm$ 7.9
$\cdot$ 不同的标注者 (C) 25.5 $\pm$ 2.5 81.1 $\pm$ 3.6 85.0 $\pm$ 1.8 68.1 $\pm$ 2.2 71.4 $\pm$ 11.1

附录 C:扩展相关工作

思维链提示是一种通用方法,受到几个先前方向的启发:提示、自然语言解释、程序合成/执行、数字和逻辑推理以及中间语言步骤。

提示

大型语言模型最近的成功引起了人们对通过提示提高执行任务的能力越来越感兴趣(Brown 等人 (2020),参见 Liu 等人 (2021) 的一项调查)。本文属于一般提示方法的范畴,即对输入提示进行优化,以允许单个大型语言模型更好地执行各种任务(Li 和 Liang,2021;Lester 等人,2021;Reif 等人,2022)。

最近的一项工作旨在通过提供描述任务的指令来提高语言模型执行任务的能力(Raffel 等人,2020;Wei 等人,2022a;Ouyang 等人,2022;Sanh 等人,2022;Wang 等人,2022b)。这一系列工作是相关的,因为它还用元数据增强了输入输出对。但是,指令增强了任务的输入(指令通常放在输入之前),而思维链提示则增强了语言模型的输出。另一个相关方向是按顺序组合语言模型的输出;人机交互 (HCI) 工作(Wu 等人,2022a;Wu 等人,2022b)表明,在 20 人用户研究中,组合连续生成的语言模型可以改善任务结果。

自然语言解释

另一个密切相关的方向使用自然语言解释(NLE),通常目的是提高模型的可解释性(Zhou 等人,2020;Wiegreffe 和 Marasović,2021)。该工作通常侧重于自然语言推理(Camburu 等人,2018;Yordanov 等人,2021;Bostrom 等人,2021),并在最终预测的同时或之后产生解释(Narang 等人,2020;Majumder 等人, 2021;Wiegreffe 等人,2021;Wiegreffe 等人,2022)。相比之下,本文考虑的思维处理链发生在最终答案“之前”。虽然 NLE 的主要目标是提高神经网络的可解释性(Rajagopal 等人,2021),但思维链提示的目标是允许模型将多跳推理任务分解为多个步骤——可解释性只是一个副作用。马拉索维奇等人。 (2022) 表明,基于提示的 NLE 微调提高了 NLI 和分类性能,尽管它们主要侧重于评估解释的合理性。相比之下,我们的工作重点是一系列需要多跳推理的算术、常识和符号任务。

程序综合与执行

使用中间推理步骤在程序合成和执行方面有着悠久的历史(Zaremba 和 Sutskever,2014)。最近在这个方向上的工作包括许多架构创新(Cai 等人,2017;Dong 等人,2019;Yan 等人,2020),以及大型语言模型的使用(Chen 等人,2021;Austin 等人,2021)。与我们最接近的程序执行工作可能是 Nye 等人。 (2021),这表明大型语言模型可以执行最多 10 位的加法、计算多项式以及执行 python 程序。虽然生成程序然后执行它可以被视为一种推理,但我们的工作将这种特定于领域的原语概括为自然语言,这是开放域的,原则上与任何文本到文本的 NLP 任务相关。

数字和逻辑推理

数字和逻辑推理一直是机器学习和自然语言处理领域长期研究的任务(Lev 等人,2004)。最近的工作还旨在以各种方式在语言模型中注入数字推理能力,例如使用一组预定义的可执行操作(Andor 等人,2019)增强 BERT,包括图神经网络(Ran 等人,2019),以及使用专门的训练程序(Piekos 等人,2021)。另一项工作旨在使语言模型能够执行逻辑或形式推理,通常是通过使用语言验证自然语言形式规则中的规则(Clark 等人,2020;Saeed 等人,2021;Liang 等人,2021)。也许这里最相关的工作是 Recchia (2021),它表明微调可以实现普通的模块操作,这对于表演者来说以前是很困难的。虽然这个方向的工作通常是针对特定任务的,并且使用微调,但我们表明,思维链提示适用于广泛的任务,无需任何微调。

中间语言步骤

大量的先前工作已经表明,赋予神经网络通过训练或微调产生中间步骤的能力,可以在一系列场景中带来各种好处。例如,已经证明自然语言中间步骤可以提高性能(Zaidan 等人,2007;Yao 等人,2021;Hase 和 Bansal,2022;Gu 等人,2022),提高鲁棒性(Chen 等人,2022),加快训练速度(Hancock 等人)等人,2018),减轻偏见(Dua 等人,2020),甚至有助于图像和强化学习设置(Andreas 等人,2018)。为了赋予模型生成中间步骤的能力,先前的工作通常在手动标注的训练数据集(Camburu 等人,2018;Rajani 等人,2019)上微调模型,或生成合成数据集(Talmor 等人,2020;Zelikman 等人,2022)。与这些训练或微调方法相比,我们的工作表明,只需通过提示,就可以在足够规模的现成语言模型中引发各种自然语言推理能力。这种提示设置很重要,因为它允许在没有大量标记标注的情况下进行中间步骤推理,并且因为单个模型可以执行一系列推理任务而无需任何梯度更新。

附录 D:附加分析

正确思维链分析

正如正文中提到的,我们分析了 LaMDA 137B 中的 50 思维链,这些思维链在 GSM8K 数据集中得出了正确答案。其中50,中只有一个通过错误的推理得出了正确答案(如2:“偶然正确”所示)。另一个 49 具有正确的逻辑和数学,示例如 1 所示。其中五个有一些小缺陷,同时保持了连贯且易于理解的逻辑:

  • 一条思维链包含未明确说明的陈述(见表 2“正确但未明确说明的陈述”)。

  • 一条思维链包含无关但正确的陈述(见表 2“正确但无关的陈述”)。

  • 两条思维链逻辑正确,但省略了方程中的具体步骤;整体仍然可以理解(见表 2“正确但方程不完整”)。

  • 一条思维链的数学计算正确,但语义关系颠倒(见表 2“正确但语义颠倒”)。

问题: 詹姆斯决定每周运行 3 冲刺 3 次。他每次冲刺跑 60 米。他每周总共跑多少米?
模型答案: James 决定每周运行 3 冲刺 3 次。他每次冲刺跑 60 米。因此,他每周跑 60 米 x 3 冲刺 x 3 次。即60 米×9. 答案是540.
问题: Brandon 的 iPhone 的历史是 Ben 的 iPhone 的四倍。 Ben 的 iPhone 比 Suzy 的 iPhone 旧两倍。如果 Suzy 的 iPhone 的使用年限为 1,那么 Brandon 的 iPhone 的使用年限是多少?
型号答案: Brandon 的 iPhone 的年龄是 Ben 的 iPhone 的 4 倍。 Ben 的 iPhone 比 Suzy 的 iPhone 旧 2 倍。所以 Brandon 的 iPhone 比 Suzy 的 iPhone 旧 4 x 2 = 8 倍。 Suzy 的 iPhone 年份为 1。所以布兰登的 iPhone 的年龄是 8 x 1 = 8 岁。答案是8.
问题: Jean 有 30 棒棒糖。 Jean 吃了 2 棒棒糖。 Jean 想要将剩余的棒棒糖包装在一个袋子中,2 棒棒糖。 Jean 可以装多少个袋子?
模型答案: Jean 从 30 棒棒糖开始。她吃了2。所以她还剩下 28 棒棒糖。她想将 2 棒棒糖包装在一个袋子中。所以她可以打包 28 / 2 = 14 包。答案是14.

GSM8K 数据集模型生成的正确思维链示例。

尽管我们发现对于最终答案正确的数学问题,思维链推理大多是正确的,但这可能是因为对于自由回答问题,很难巧合地得出正确的最终答案。对于多项选择或二元分类问题,模型更有可能通过不正确的推理路径(例如,我们评估的所有常识推理数据集)得出正确答案。这是一个限制,未来的工作应该对这种思维链的真实性进行分析。

问题: 有36企鹅在雪地里晒日光浴。其中三分之一跳入海中游泳。另外三分之一的人进入洞穴吃晚餐。有多少只企鹅还在晒日光浴?
型号答案: 有36企鹅。其中三分之一跳入海中游泳。这就是 12 企鹅。另外三分之一的人进入洞穴吃晚餐。这就是 12 企鹅。答案是12.
问题: 约翰拥有 2 房屋,每栋房屋均配有 3 卧室。每间卧室均设有 2 窗户。每栋房屋还有一个 4 窗户,不与卧室相连。房屋之间总共有多少扇窗户?
模型答案: 有 2 房屋,每栋房屋都有 3 卧室。每间卧室均设有 2 窗户。所以每间房子都有 2 x 3 = 6 窗户。每栋房屋还有一个额外的 4 窗户,未与卧室相连。所以每栋房子都有4 + 4 = 8 窗户。所以每间房子都有 6 x 2 = 12 窗户。所以两栋房子都有12 + 8 = 20 窗户。答案是20.
问题: 如果安的年龄是 9 岁,而她的哥哥是她的两倍,那么 3 年后她哥哥的年龄是多少?
型号答案: 安的年龄为 9 岁。她哥哥的年龄是她的两倍。所以她哥哥的年龄是18。在 3 年,她将是 12. 所以她的兄弟将是 18 + 3 = 21 岁。答案是21.
问题: 当地加油站的汽油售价为每加仑 $3.00。某应用提供每加仑 $0.20 的返现。如果有人购买 10 加仑汽油,获得返现后实际花费多少?
型号答案: 气体原价为每加仑 3 美元。如果您购买 10 加仑,即 3 x 10 = 30 美元。如果每加仑获得 20 美分,即 20 x 10 = 2 美元。因此总计为 30 - 2 = 28 美元。答案是28元。
问题: Nissa 雇用 60 季节性工人在她的百货公司的圣诞老人村里扮演精灵。三分之一的精灵在孩子们吐到他们身上后退出了,然后 10 剩下的精灵在孩子们踢他们的小腿后退出了。还剩多少精灵?
模型答案: Nissa 雇用 60 季节工。其中三分之一退出了。所以60 - 1/3 = 40 精灵就剩下了。然后10精灵退出了。所以40 - 10 = 30 精灵就剩下了。答案是30精灵。
问题: 琼斯奶奶为消防员的午餐烤了 5 苹果派。她将每个馅饼切成8块,然后将五个馅饼放在自助餐桌上,供客人自行享用。晚上结束时,客人们拿走并吃掉他们的馅饼后,还剩下 14 块馅饼。客人拿走了多少件?
模型答案: 5馅饼被烘烤并切成8块。随后将5馅饼送给客人。 8 x 5 = 40 一块馅饼。客人们吃了14块馅饼。 40 - 14 = 26 剩下了一块馅饼。答案是26.

在模型正确的 50 示例中,存在 7 模型生成的思维链不完善的突出情况。我们发现另一个 43 相当于人类可能生成的基本事实。

错误思维链分析

我们还手动分析了 50 模型的随机采样输出,这些输出在 GSM8K 上不正确,为 LaMDA 137B。思维链可能在很多方面出现错误,这使得错误分类的设计变得非常重要。我们决定将错误分类为需要进行哪些更改才能使思维链正确,目的是阐明未来如何改进模型。

我们发现,通过以下三类修改之一可以纠正许多思维链。

  • **仅计算器错误。**我们发现,除了计算器错误之外,8% 的思维链完全正确,换句话说,将外部计算器应用于方程,就像 Cobbe 等人所做的那样。 (2021),将使思维链正确。 3:“仅计算器错误”中显示了此类错误的示例。事实上,当我们添加一个 Python 程序作为外部计算器时,LaMDA 137B GSM8K 的思维链提示的解题率从 14.3% 上升到 17.3%,如 相应表格 所示。此外,除了其他类型的错误之外,示例中的 34% 还包含计算器错误。但是,我们将独立于计算器错误来执行其余的错误分类。

  • 符号映射错误。 接下来我们发现,除了我们所说的符号映射错误之外,16% 的思维链中有 % 是正确的。我们将符号映射错误定义为除了数字符号之外的思维链是正确的,并且可以通过仅修改方程而不修改单词来使其完全正确。正如人们可能会争辩的那样,他们可以简单地将正确的最终方程放入任何思维链中,我们将这一类别限制为思维链,其中思维链可以被修改为完全正确的推理过程(而不仅仅是最终答案)。 3:“符号映射错误”中显示了此错误类别的示例。

  • **缺少一步错误。**我们的下一类错误是思维链,除了缺少一步之外,这些思维链都是正确的。换句话说,通过添加模型遗漏的额外推理步骤,可以将这些思维链重写为正确的。 3:“一步丢失错误”中显示了此错误类别的示例。我们发现 22% % 的错误属于此类。

问题: 丹植物 3 玫瑰丛。每个玫瑰丛都有 25 玫瑰。每朵玫瑰都有8 刺。总共有多少根刺?
型号答案: 丹植物 3 玫瑰丛。每个玫瑰丛都有 25 玫瑰。每朵玫瑰都有8 刺。所以 3 x 25 x 8 = 300. 答案是 300.
错误类别的解释: 只需通过外部计算器运行方程即可使产生的思维链正确,而不是要求模型进行计算。
问题: Jill 当教师的时薪为 $20,当啦啦队教练的时薪为 $30。如果她每年工作 50 周,每周任教 35 小时、执教 15 小时,她的年薪是多少?
模型答案: Jill 任教的时薪为 20 美元,担任啦啦队教练的时薪为 30 美元。她每年任教 50 x 35 = 1750 小时,并担任教练 15 x 30 = 450 小时。因此她共工作 1750 + 450 = 2200 小时。她的年薪是 20 x 1750 + 30 x 450 = $36,500。答案是 $36,500。
错误类别的解释: 该模型错误地映射了“15 x 30”而不是“15 x 50”,并且通过仅修复一个更改(使用外部计算器)即可使思维链正确。
问题: Kelian有两个准备菜肴的食谱,一个有20说明,第二个有第一个的两倍的说明。为了准备这两道菜,Kelian 需要阅读多少份说明?
型号答案: Kelian有两个食谱。其中一个有 20 指令。另一个的指令数量是第一个的两倍。所以第二个有 40 指令。所以Kelian必须阅读40的说明来准备这两道菜。答案是40.
错误类别的解释: 只需添加一个额外步骤(在本例中,添加 20 和 40)即可使模型答案正确。

错误思维链的示例,分类如 附录 D.2 中所述。

我们发现其余的思维链(50 的 27;54%)需要大量编辑才能形成正确的思维链。这里几乎所有的案例都涉及语义理解上的错误(参见4:“语义理解错误”),而27的8也存在不连贯的思维链,这意味着生成的思维链中的某些陈述与先前的陈述不相符或违反了基本的世界知识(参见4:“思维链不连贯错误”)。

问题: Gretchen 拥有 110 硬币。金币比银币多30。格雷琴有多少金币?
模型答案: Gretchen 拥有 110 硬币。金币比银币多30。所以有110 - 30 = 80 银币。所以有80银币和110 - 80 = 30金币。答案是30.
错误类别的解释: 该模型无法理解 110 硬币的总数,并且它必须解方程才能获得金币和银币的数量。
问题: 在20学生的舞蹈班中,20%报名了现代舞,其余的25%报名了爵士舞,其余的报名了街舞。参加嘻哈舞的学生占全部学生的比例是多少?
典型答案: 20% 就读现代舞的学生。其余学生25%就读于爵士舞。其余的人参加了嘻哈舞蹈。所以街舞舞蹈占全部学生的比例就是街舞舞蹈学生的比例减去现代舞学生的比例,再减去爵士舞学生的比例。所以就读嘻哈舞的学生占全部学生的比例为(25 + 20) - (25 + 20) = 100%。答案是100%。
错误类别的解释: 这种思维链是不连贯的,因为参加嘻哈舞蹈的学生总数的百分比不能等于参加嘻哈舞蹈的学生的百分比减去另一项。

错误思维链的示例,分类如 附录 D.2 中所述。这些思维链存在多个错误,无法通过较小的修改来修复。

总体而言,不能保证大型语言模型生成的推理过程是连贯的或事实上正确的,正如最近评估语言模型生成和解释的真实性的工作所强调的那样(Maynez 等人,2020;Rashkin 等人,2021;Ye 和 Durrett,2022;Marasović 等人, 2022;Wiegreffe 等人,2022)。不正确的推理过程可能会导致错误的最终答案以及意外正确的最终答案(意外正确的最终答案更有可能出现在二元分类等任务中,而不是自由响应)。提高语言模型生成相对于上下文和世界知识的真实性是语言模型研究中一个重要的开放问题方向,也有望潜在地提高语言模型的多步推理能力。提高解码质量的一种潜在方法可能涉及生成多个推理路径并使用验证器对每个推理路径进行评分,但这需要训练验证器(Cobbe 等人,2021;Shen 等人,2021;Thoppilan 等人,2022)。

附加稳健性分析

由于主论文中的实验使用固定数量的少样本样本(8;受 1024 标记的输入长度限制),我们验证了思维链提示对于各种数量的少样本样本具有鲁棒性。我们对 LaMDA 137B 进行了实验,对五个数据集进行了思维链提示与标准提示的比较,其中标准提示的缩放曲线基本平坦(最大的模型没有实现高性能)。如 图 11 所示,思维链提示相对于标准提示的改进对于改变提示中的少样本样本数量仍然具有鲁棒性。

![图 11:不同少样本示例数量下的结果](https://course-media.xlearnity.ai/pandatalk/1785811633893-0ca8e134.png)
思维链提示相对于标准提示的改进对于改变提示中的少样本样本的数量似乎是稳健的。
数据集 $N$ 示例问题
GSM8K 1,319 Josh 决定尝试翻修并转售一栋房屋。他以 $80,000 买下房子,又投入 $50,000 维修,使房屋价值提高了 150%。他获得了多少利润?
SVAMP 1,000 每包 DVD 的售价为 76 美元。如果每包有25美元的折扣。购买每包需要花多少钱?
ASDiv 2,096 艾伦比马林多六个球。马林有九个球。艾伦有多少个球?
AQuA 254 一辆汽车以匀速直线行驶,驶向垂直塔的底部。从汽车上观察塔顶,在此过程中,仰角从 45$^{\circ}$ 变为 60$^{\circ}$ 需要 10 分钟。这辆车还要多长时间才能到达塔底?答案选项: (a) 5$\sqrt{3}$ + 1 (b) 6$\sqrt{3}$ + $\sqrt{2}$ (c) 7$\sqrt{3}$ - 1 (d) 8$\sqrt{3}$ - 2 (e) 这些都不是
MAWPS: SingleOp 562 如果一个盒子里有 7 瓶盖,Linda 在里面又放了 7 瓶盖,那么盒子里有多少个瓶盖?
MAWPS: SingleEq 508 本尼花了 2 美元买了一杯软饮料和 5 糖果。他一共花了27元。每块棒棒糖多少钱?
MAWPS: AddSub 395 花瓶里有6玫瑰。玛丽从她的花园里剪下了一些玫瑰。花瓶里现在有 16 玫瑰。她剪了多少朵玫瑰花?
MAWPS: MultiArith 600 学校食堂订购了42红苹果和7青苹果作为学生午餐。但是,如果只有9的学生想要水果,那么食堂最后会多出多少呢?

附录 E:其他详细信息

版本控制

V5 $\rightarrow$ V6。修复了图 3. 中的小拼写错误

V4 $\rightarrow$ V5。添加了 Codex 和 UL2 结果。写作和纸张风格的小变化。

V3 $\rightarrow$ V4。修复了图 3 中的拼写错误并添加了一些引文。

V2 $\rightarrow$ V3。添加了 GPT-3 结果。添加了 SVAMP 和 AQuA 数学评估数据集。添加了 SayCan 评估常识。添加了扩展相关工作部分(附录 C)。添加了常识和符号推理的消融(相应表格)。添加了常见问题解答部分(附录 A)。在 附录 B 中添加原始结果。

V1 $\rightarrow$ V2。添加了 PaLM 结果(V1 仅具有 LaMDA)。

再现性声明

由于我们的结果使用了两组未公开提供的大型语言模型,因此我们采取以下措施来促进可重复性。首先,我们为附录 G中的1219中的所有任务提供准确的输入提示(并强调我们不执行任何微调)并且仅将提示应用于现成的语言模型)。其次,我们使用公开的 GPT-3 API 对四种模型尺度进行实验(text-ada-001, text-babbage-001, text-curie-001, text-davinci-002)。最后,我们为每个任务的 LaMDA 137B 提供准确的输入、目标和预测,可在补充材料中以 zip 文件形式提供。

计算资源

对于我们评估的所有三种语言模型,我们仅进行基于提示的推理。本文未进行任何微调。对于 LaMDA 137B 的推理,我们使用 TPU v3(8x8 配置、64 芯片/128 内核),对于 PaLM 540B 的推理,我们使用 TPU v4 (4x4x12 配置、192 芯片/384 内核)。 GPT-3实验是使用公共API完成的。^5

数据集详细信息和许可证

我们列出了本文中使用的所有算术和常识数据集的详细信息和许可。符号推理数据集是综合创建的,如 第 4 节 中所述。

算术推理

常识推理

BIG-Bench 的 - Date 理解和运动理解(BIG-bench 协作,2021):Apache 许可证 v.2:https://github.com/google/BIG-bench/blob/main/LICENSE

附录 F:输入/输出示例

问题: 取出“Waldo Schmidt”中单词的最后一个字母并将它们连接起来。
型号答案: “Waldo”的最后一个字母是“o”。 “Schmidt”的最后一个字母是“t”。连接它们就是“ot”。所以答案是ot。
问题: 取出“Daniel Friedman”中单词的最后一个字母并将它们连接起来。
型号答案: “Daniel”的最后一个字母是“l”。 “弗里德曼”的最后一个字母是“m”。将它们连接起来就是“lm”。所以答案是lm。

LaMDA 137B 在字母连接任务中产生的正确和错误思维链示例。

问题: 一枚硬币正面朝上。安德烈抛硬币。奥德里没有掷硬币。硬币还正面吗?
模型答案: 硬币被安德烈抛了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以在抛掷奇数次后,它就会反面朝上。所以答案是否定的。
问题: 一枚硬币正面朝上。克里斯蒂安没有抛硬币。达拉斯不会掷硬币。硬币还正面吗?
模型答案: 硬币被克里斯蒂安翻转了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以在抛掷奇数次后,它就会反面朝上。所以答案是否定的。

LaMDA 137B 在 coinflip 任务中产生的正确和错误思维链示例。

问题: 当一个人开始工作时,他们在建造什么?
答案选择:(a) 时间 (b) 完成 (c) 工作 (d) 动力 (e) 疲劳
模型答案: 答案必须是已构建的东西。在上述选择中,只是建立了动力。所以答案是(d)。
问题: 您可能在哪里找到汉堡包?
选项:(a) 快餐店 (b) 披萨 (c) 磨碎的死牛 (d) 嘴巴 (e) 牛尸体
模型答案: 答案必须是找到汉堡包的地方。在上述选择中,只有快餐店提供汉堡包。所以答案是(a)。
问题: 除了水和营养之外,您的狗还需要什么?
答案选项:(a) 骨头 (b) 魅力 (c) 抚摸 (d) 大量关注 (e) 行走
模型答案: 答案必须是狗需要的东西。在上述选择中,只有骨头是狗需要的。所以答案是(a)。 ✗(基本事实是 (d)。)
问题: 当您在接待区时,您在等待什么?
答案选择: (a) 汽车旅馆 (b) 椅子 (c) 医院 (d) 人 (e) 酒店
型号答案: 答案必须是在接待区等待您的东西。在上述选择中,只有有人在接待区等候您。所以答案是(e)。 ✗(基本事实是 (d)。)

LaMDA 137B 在 CSQA 上产生的正确和错误思维链的示例。

问题: 《驱魔人》会刺激边缘系统吗?
模型答案: 《驱魔人》是一部恐怖电影。恐怖电影很可怕。边缘系统与恐惧有关。因此,《驱魔人》会刺激边缘系统。所以答案是肯定的。
问题: 杰克逊·波洛克受过达·芬奇训练吗?
模型答案: 达芬奇生活在15世纪。杰克逊·波洛克生活在 20 世纪。因此,杰克逊·波洛克不可能接受过达·芬奇的训练。所以答案是否定的。
问题: 哈利·波特可以预订韩亚航空的航班吗?
模型答案: 哈利·波特是一个虚构人物。因此,哈利·波特可以做任何事情。所以答案是肯定的。 ✗(基本事实是“不”。)
问题: 智者会使用重剑吗?
模型答案: 智者是擅长说服艺术的人。重剑是剑的一种。因此,智者可以使用重剑。所以答案是肯定的。 ✗(基本事实是“不”。)

LaMDA 137B 在 StrategyQA 上产生的正确和错误思维链的示例。

问题: 五月6, 1992对Jane来说就像昨天一样,但那实际上是十年前的事了。一个月前的日期(MM/DD/YYYY)是多少?
模型答案: 五月 6, 1992 是十年前,所以今天是五月 6, 2002. 所以一个月前将是四月 6, 2002. 所以答案是04/06/2002.
问题: 这是 1899. 的最后一天,24 几小时后的日期(MM/DD/YYYY)是多少?
型号答案: 今天是 12/31/1899. 24 小时后将是 01/01/1900. 所以答案是01/01/1900.
问题: Jane 安排了明天与 5 人员的 3 约会(星期二,7/9/1972)。从今天开始一周前的日期(MM/DD/YYYY)是多少?
型号答案: 明天是 7/9/1972. 从今天起一周前是 7/2/1972. 所以答案是7/2/1972. ✗(基本事实是 07/01/1972.)
问题: 今天是 2020, 的回文日,因为日期的 MMDDYYYY 格式向后与向前相同。明天的日期(MM/DD/YYYY)是多少?
型号答案: 今天是 02/29/2020. 明天是 03/01/2020. 所以答案是03/01/2020. ✗(基本事实是“02/03/2020”。)

LaMDA 137B 在日期理解上产生的正确和错误思维链的示例。

问题: 以下句子是否合理? “若奥·穆蒂尼奥排名第三。”
模型答案: 若昂·穆蒂尼奥 (Joao Moutinho) 是一名足球运动员。获得第三名是棒球的一部分,而不是足球的一部分。所以答案是否定的。
问题: 以下句子是否合理? “马尔科姆·布罗格登在 NBA 锦标赛中用欧洲步上篮。”
模型答案: 马尔科姆·布罗格登是一名篮球运动员。欧洲步上篮是篮球的一部分。所以答案是肯定的。
问题: 以下句子是否合理? “德里克·怀特反手击球。”
模型答案: Derrick White 是一名篮球运动员。反手投篮是篮球运动的一部分。所以答案是肯定的。 ✗(事实是“不”,反手击球是曲棍球的一部分。)
问题: 以下句子是否合理? “纳泽姆·卡德里在家。”
模型答案: Nazem Kadri 是一名曲棍球运动员。呆在家里是曲棍球的一部分。所以答案是肯定的。 ✗(事实是“不”,呆在家里是棒球的一部分。)

LaMDA 137B 关于运动理解的正确和错误思维链示例。

问题: 我把可乐洒在桌子上了,你能把它扔掉,然后给我拿一些东西来帮助清理吗?
模型答案: 解释:用户将可乐洒在了桌子上。我会扔掉可乐,然后给用户带来一块海绵。计划:查找(可乐)、挑选(可乐)、查找(垃圾)、放置(可乐)、查找(海绵)、挑选(海绵)、查找(桌子)、放置(海绵)。
问题: 你能为我堆肥那个苹果吗?
模型答案: 解释:用户希望我对苹果进行堆肥。我会把苹果移到堆肥里。计划:查找(苹果)、挑选(苹果)、查找(垃圾)、放置(苹果)。
问题: 你能给我一杯不是可乐的饮料吗?
模型答案: 解释:用户要求我带一杯不是可乐的饮料,我会带一罐雪碧。计划:查找(雪碧)、拿起(雪碧)、查找(用户)、放下(雪碧)。✗(可行答案包括酸橙汽水、百事可乐、柚子汽水或水;场景中没有表 20 所定义的雪碧。)
问题: 你能给我拿点咸的吗?
模型答案: 解释:用户想要咸的东西。对象列表中有几个选项,所以我会给用户带来一杯石灰苏打水。计划:查找(石灰苏打水)、挑选(石灰苏打水)、查找(用户)、放置(石灰苏打水)。 ✗(可行的答案包括寻找碎片。该模型将石灰苏打水误认为是咸的。)

PaLM 540B 在 SayCan 机器人规划任务上产生的正确和错误思维链示例。

附录 G:完整提示

数学应用题提示
问: 树林里有 15 树。树林里的工人今天将在树林里植树。完成后,就会有21树。今天果园工人种了多少棵树?
A: 原来有 15 树。又种了一些,就有了21树。所以一定有21 - 15 = 6. 答案是6.
问: 如果停车场有 3 车,还有 2 车到达,那么停车场有多少辆车?
答: 原来有3 车。 2 更多车辆抵达。 3 + 2 = 5. 答案是 5.
问: Leah 有 32 巧克力,她姐姐有 42. 如果他们吃了 35,,他们总共还剩下多少块?
A: 最初,Leah 有 32 巧克力。她姐姐有 42. 所以他们总共有 32 + 42 = 74. 吃了 35, 后他们有 74 - 35 = 39. 答案是39.
问: Jason 有 20 棒棒糖。他给了丹尼一些棒棒糖。现在 Jason 有了 12 棒棒糖。杰森给了丹尼多少根棒棒糖?
A: Jason 从 20 棒棒糖开始。然后他给了丹尼一些后得到了12。所以他给了Denny 20 - 12 = 8. 答案是8.
问: 肖恩有五个玩具。圣诞节时,他从爸爸妈妈那里各收到了两个玩具。他现在有多少个玩具?
答: Shawn 是从 5 玩具开始的。如果他从妈妈和爸爸那里各得到了 2 玩具,那么那就是 4 更多玩具。 5 + 4 = 9. 答案是 9.
问: 服务器机房有九台计算机。从周一到周四,每天都会安装五台计算机。服务器机房现在有多少台计算机?
答: 最初有 9 计算机。每 4 天,都会添加更多的计算机 5。因此添加了 5 * 4 = 20 计算机。 9 + 20 是 29. 答案是 29.
问: 迈克尔有 58 高尔夫球。周二,他丢失了 23 高尔夫球。周三,他又失去了2。星期三结束时他有多少个高尔夫球?
答: Michael 从 58 高尔夫球开始。周二失去 23 后,他拥有 58 - 23 = 35. 在失去 2 后,他拥有 35 - 2 = 33 高尔夫球。 答案是33.
问: Olivia 有 $23。她以每个 $3 的价格买了五个贝果。她还剩多少钱?
答: Olivia 有 23 美元。每个 5 百吉饼的 3 美元将为 5 x 3 = 15 美元。所以她还剩下 23 - 15 美元。 23 - 15 是 8. 答案是 8.

完整的思维链的少样本提示了数学应用题。这组范例用于除 AQuA 之外的所有数学应用题数据集。

AQuA 代数应用题提示
问: John 发现 15 数字的平均值是 40. 如果将 10 添加到每个数字,那么这些数字的平均值是?
答案选择: (a) 50 (b) 45 (c) 65 (d) 78 (e) 64
A: 如果每个数字都加上 10,那么数字的平均值也会增加 10. 所以新的平均值将是 50. 答案是 (a)。
问: 如果 a / b = 3/4 且 8a + 5b = 22,,则求 a 的值。
答案选项: (a) 1/2 (b) 3/2 (c) 5/2 (d) 4/2 (e) 7/2
A: 如果 a / b = 3/4, 则 b = 4a / 3. 所以 8a + 5(4a / 3) = 22. 这简化为 8a + 20a / 3 = 22, 这意味着 44a / 3 = 22. 所以 a 等于3/2. 答案为(b)。
问: 一个人以 20 公里/小时的速度行驶,并在 2.5 小时内到达他的目的地,那么求距离?
答案选项: (a) 53 公里 (b) 55 公里 (c) 52 公里 (d) 60 公里 (e) 50 公里
答: 该人行驶的距离为 20 公里/小时 * 2.5 小时 = 50 公里。 答案是 (e)。
问: 输入从 1 到 500 的数字需要多少次按键?
答案选择: (a) 1156 (b) 1392 (c) 1480 (d) 1562 (e) 1788
A: 从 1 到 9. 有 9 一位数 从 10 到 99. 有 90 两位数 从 100 有 401 三位数则 500. 9 + 90(2) + 401(3) = 1392. 答案为 (b)。

AQuA 的完整思想提示的少样本。

最后一个字母连接提示
问: 取出“Elon Musk”中单词的最后一个字母并将它们连接起来。
A: “Elon”的最后一个字母是“n”。 “Musk”的最后一个字母是“k”。将它们连接起来就是“nk”。 答案是nk。
问: 取出“Larry Page”中单词的最后一个字母并将它们连接起来。
A: “Larry”的最后一个字母是“y”。 “Page”的最后一个字母是“e”。连接起来就是“ye”。 答案是ye。
问: 取出“Sergey Brin”中单词的最后一个字母并将它们连接起来。
A: “Sergey”的最后一个字母是“y”。 “Brin”的最后一个字母是“n”。将它们连接起来就是“yn”。 答案是yn。
问: 取出“Bill Gates”中单词的最后一个字母并将它们连接起来。
A: “Bill”的最后一个字母是“l”。 “Gates”的最后一个字母是“s”。将它们连接起来就是“ls”。 答案是ls。

完整的思维链的少样本提示了最后一个字母连接任务。

抛硬币提示
问: 问:一枚硬币正面朝上。卡掷硬币。雪莉掷硬币。硬币还正面吗?
A: Ka 和 Sherrie 翻转了硬币。所以这枚硬币被翻转了 2 次,是偶数。硬币一开始是正面朝上的,所以抛偶数次后,它仍然是正面朝上的。 所以答案是肯定的。
问: 一枚硬币正面朝上。杰米抛硬币。特蕾莎抛硬币。硬币还正面吗?
A: 硬币被 Jamey 和 Teressa 翻转了。所以这枚硬币被翻转了 2 次,是偶数。硬币一开始是正面朝上的,所以抛偶数次后,它仍然是正面朝上的。 所以答案是肯定的。
问: 一枚硬币正面朝上。梅贝尔抛硬币。莎朗达没有掷硬币。硬币还正面吗?
A: 硬币被 Maybelle 翻转了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以抛奇数次后,它就会反面朝上。 所以答案是否定的。
问: 一枚硬币正面朝上。米利森特不会掷硬币。构想翻转硬币。硬币还正面吗?
A: 硬币被Conception 翻转了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以抛奇数次后,它就会反面朝上。 所以答案是否定的。
问: 一枚硬币正面朝上。萨尔掷硬币。雷蒙德没有掷硬币。硬币还正面吗?
A: 硬币被 Sal 翻转了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以抛奇数次后,它就会反面朝上。 所以答案是否定的。
问: 一枚硬币正面朝上。构想翻转硬币。克里斯蒂安没有抛硬币。硬币还正面吗?
A: 硬币被Conception 翻转了。所以硬币被翻转了1次,这是一个奇数。硬币一开始正面朝上,所以抛奇数次后,它就会反面朝上。 所以答案是否定的。
问: 一枚硬币正面朝上。英加没有掷硬币。埃拉诺没有抛硬币。硬币还正面吗?
A: 这枚硬币没有被人翻转。所以这枚硬币被翻转了 0 次。硬币开始正面朝上,并且没有翻转,所以仍然是正面朝上。 所以答案是肯定的。
问: 一枚硬币正面朝上。瑞安抛硬币。尚达掷硬币。硬币还正面吗?
A: 硬币被 Ryan 和 Shaunda 翻转。所以这枚硬币被翻转了 2 次,是偶数。硬币一开始是正面朝上的,所以抛偶数次后,它仍然是正面朝上的。 所以答案是肯定的。

完整的思维链的少样本提示了抛硬币任务。

提示 CSQA
问: 人们用什么来吸收钢笔中多余的墨水?答案选择:(a) 衬衫口袋 (b) 书法家的手 (c) 墨水瓶 (d) 书桌抽屉 (e) 记事本
A: 答案一定是可以吸收墨水的物品。上述选项中,仅使用吸墨纸来吸收墨水。 所以答案是(e)。
问: 哪些家庭娱乐设备需要电缆?
答案选择:(a) 广播室 (b) 变电站 (c) 电视 (d) 柜子
A: 答案必须需要电缆。在上述选择中,只有电视需要有线电视。 所以答案是(c)。
问: 狐狸从城市走进森林,它在寻找什么?答案选择:(a) 美丽的花朵 (b) 鸡舍 (c) 自然栖息地 (d) 故事书
A: 答案一定是森林里的东西。上述选项中,只有自然栖息地在森林中。 所以答案是(b)。
问: Sammy 想去人们所在的地方。他可能会去哪里?答案选择: (a) 人口稠密地区 (b) 赛道 (c) 沙漠 (d) 公寓 (e) 路障
A: 答案一定是人多的地方。以上选择中,只有人口稠密的地区人才多。 所以答案是(a)。
问: 退房前你把葡萄放在哪里?答案选择:(a)嘴(b)杂货车(c)超市(d)水果篮(e)水果市场
A: 答案应该是结账前放置杂货的地方。在上述选择中,杂货车对于存放杂货物品最有意义。 所以答案是(b)。
问: Google 地图和其他高速公路和街道 GPS 服务已经取代了什么?答案选择:(a) 美国 (b) 墨西哥 (c) 乡村 (d) 阿特拉斯
答: 答案一定是用来做 Google 地图和 GPS 服务所做的事情,即指路。上述选项中,仅使用地图册来给出方向。 故答案为(d)。
问: 离婚前,做所有工作的妻子感觉如何?答案选择: (a) 更难 (b) 痛苦 (c) 苦涩 (d) 眼泪 (e) 悲伤
答: 答案应该是离婚的人包揽一切的感觉。在以上选择中,最接近的感觉是苦涩。 所以答案是(c)。

CSQA 的完整思想提示的少样本。由于空间原因,表格中省略了答案选项之间的换行符。

提示 StrategyQA
问: 仓鼠为任何动物提供食物吗?
A: Hamsters 是被捕食动物。猎物是掠食者的食物。因此,仓鼠为某些动物提供食物。 所以答案是肯定的。
问: 波姬小丝能在宾夕法尼亚大学取得成功吗?
A: 波姬小丝就读于普林斯顿大学。普林斯顿大学的学术严谨程度与宾夕法尼亚大学相当。因此,波姬小丝也可以在宾夕法尼亚大学取得成功。 所以答案是肯定的。
**问:**是或否:氢原子序数的平方超过辣妹的数量?
A: 氢的原子序数为1. 1的平方为1. 有5辣妹。因此,氢的原子序数平方小于 5. 所以答案是否定的。
问: 是或否:在一些大学毕业典礼期间看到霜冻是否很常见?
答: 大学毕业典礼可以在 12 月、5 月和 6 月举行。 12月是冬季,所以可能会出现霜冻。因此,在某些开始时可能会出现霜冻。 所以答案是肯定的。
**问:**是或否:美洲驼在越南战争期间可以生育两次吗(1945-46)?
答: 越南战争历时 6 个月。美洲驼的妊娠期为11个月,比6个月多。因此,在越南战争期间,美洲驼不可能生育两次。 所以答案是否定的。
**问:**是或否:梨会沉入水中吗?
答: 一个梨的密度约为$0.6 g/cm^3$,小于水。密度小于水的物体会漂浮。因此,梨会漂浮。 所以答案是否定的。

StrategyQA 的完整思想提示的少样本。

日期理解提示
问: 2015 将在 36 小时内到来。从今天起一周后的日期(MM/DD/YYYY)是多少?
答: 如果 2015 在 36 小时内到达,那么它将在 2 天后到达。 2 01/01/2015 之前的天是 12/30/2014, 所以今天是 12/30/2014. 所以从今天开始一周将是 01/05/2015. 所以答案是 01/05/2015.
问: 2019 的第一天是星期二,今天是 2019. 的第一个星期一,MM/DD/YYYY 今天是几号?
答: 如果 2019 的第一天是星期二,那么 01/01/2019 就是星期二。今天是第一个星期一,六天后就是了。所以今天是 01/07/2019. 所以答案是 01/07/2019.
问: 演唱会原定于06/01/1943,举行,但推迟了一天到今天。 10 天前的日期(MM/DD/YYYY)是多少?
A: 06/01/1943 后一天是 06/02/1943, 所以今天是 06/02/1943. 10 前天是 05/23/1943. 所以答案是 05/23/1943.
问: 今天是 4/19/1969。 MM/DD/YYYY 小时后的日期 24 是什么?
A: 今天是 04/19/1969. 24 小时后是今天后的一天,这将是 04/20/1969. 所以答案是04/20/1969.
问: Jane 认为今天是 3/11/2002,,但今天实际上是 3 月 12,,即 1 一天后。 MM/DD/YYYY 小时后的日期 24 是什么?
A: 今天是 03/12/2002. 所以 24 小时后的日期将是 03/13/2002. 所以答案是03/13/2002.
问: Jane 于二月最后一天出生于 2001. 今天是她 16 岁生日。昨天的日期(MM/DD/YYYY)是多少?
A: 二月的最后一天是 28 日,所以 Jane 出生于 02/28/2001. 今天是她的 16 岁生日,所以今天是02/28/2017. 所以昨天是 02/27/2017. 所以答案是 02/27/2017.

完整的思维链的少样本提示了日期理解。

运动理解提示
问: 下面这句话合理吗? “凯尔·帕尔米耶里因砍伤而被传唤。”
答: 凯尔·帕尔米耶里 (Kyle Palmieri) 是一名曲棍球运动员。被要求砍伤是曲棍球的一部分。 所以答案是肯定的。
问: 下面这句话合理吗? “若昂·穆蒂尼奥在国联锦标赛中接住了掩护传球。”
A: 若昂·穆蒂尼奥是一名足球运动员。 NFC锦标赛是美式足球的一部分,而不是足球。 所以答案是否定的。
问: 下面这句话合理吗? “卡森·温茨负责挡拆。”
A: Carson Wentz 是一名美国橄榄球运动员。挡拆是篮球的一部分,不是足球的一部分。 所以答案是否定的。
问: 下面这句话合理吗? “乔纳斯·瓦兰丘纳斯压哨了。”
A: Jonas Valanciunas 是一名篮球运动员。压哨是篮球的一部分。 所以答案是肯定的。
问: 下面这句话合理吗? “贾梅尔·穆雷在比赛中表现得非常完美。”
答: 贾马尔·穆雷是一名篮球运动员。完美的罚球线是篮球的一部分。 所以答案是肯定的。
问: 下面这句话合理吗? “萨姆·达诺德传球了。”
答: 萨姆·达诺德是一名美国橄榄球运动员。传球是曲棍球的一部分,而不是美式足球。 所以答案是否定的。
问: 下面这句话合理吗? “德雷蒙德·格林触地得分。”
A: 德雷蒙德·格林是一名篮球运动员。达阵是足球的一部分,而不是篮球的一部分。 所以答案是否定的。
问: 下面这句话合理吗? “马尔科姆·布罗格登将球投进了球门。”
答: 马尔科姆·布罗格登是一名篮球运动员。投篮是篮球的一部分。 所以答案是肯定的。

完整的思维链的少样本提示了运动理解。

SayCan 机器人规划提示
位置 = [柜台、桌子、用户、垃圾桶、碗]。
对象 = [7up、苹果、水壶片、茶、杂粮片、可乐、酸橙汽水、墨西哥辣椒片、米片、橙子、葡萄柚汽水、百事可乐、红牛、能量棒、海绵、水]。
机器人可以使用 pick(object) 拾取物品并使用 put(object) 放下物品以及使用 find() 查找对象或位置。机器人只能理解列出的明确位置和物体。
人类:我饿了,你能给我一些薯片吗?
解释用户饥饿,已索要筹码。芯片有好几种类型,我会给用户带来水壶芯片。
计划:1. find(水壶筹码)、2. pick(水壶筹码)、3. find(用户)、4. put(水壶筹码)、5. done()。
人类:你会如何将柚子饮料从桌子移到柜台上?
说明用户要求我将柚子饮料移至柜台。
计划:1. find(西柚汽水)、2. pick(西柚汽水)、3. find(柜台)、4. put(西柚汽水)、5. done()。
人类:你怎么给我带点零食?
解释用户要求吃零食,我会选择两件并带上。我会带墨西哥辣椒片和一个苹果。
计划:1. find(墨西哥辣椒片)、2. pick(墨西哥辣椒片)、3. find(用户)、4. put(墨西哥辣椒片)、5. find(苹果)、6. pick(苹果)、7.查找(用户),8. put(苹果),9. 完成()。
人类:你怎么给我带来一些不是水果的东西?
解释用户要求提供一种不是水果的食物,我会给他们带来能量棒。
计划:1. find(能量条)、2. pick(能量条)、3. find(用户)、4. put(能量条)、5. did()。
:怎么把米片放进碗里,然后把茶搬到桌子上?
解释用户要求我做两项任务,我会先做一项,然后再做另一项。
计划:1.找到(米片),2.挑(米片),3.找到(碗),4.放(米片),5.找到(茶),6.挑(茶),7.找到(桌子), 8.放(茶),9.完成()。
人类:你会如何扔掉红牛?
说明用户要求我扔掉红牛,我将其移至垃圾桶。
计划:1. 查找(红牛)、2. 挑选(红牛)、3. 查找(垃圾)、4. 放置(红牛)、5. 完成()。
人类:给我一杯饮料。
解释用户要求喝一杯,有多种选择。我会给他们带水。
计划:1. 查找(水)、2. 拾取(水)、3. 查找(用户)、4. 放置(水)、5. 完成()。

用于 SayCan 机器人规划任务的完整思想提示的少样本。

附录 H:MWP 的备用标注者

数学应用题提示
问: 树林里有 15 树。树林里的工人今天将在树林里植树。完成后,就会有21树。今天果园工人种了多少棵树?
A: 现在有 21 树,最初有 15 树,所以工人们种植 21 - 15 = 6 树。 答案是 6.
问: 如果停车场有 3 车,还有 2 车到达,那么停车场有多少辆车?
A: 一开始有 3 车,2 更多到达,所以现在应该有 3 + 2 = 5 车。 答案是 5.
问: Leah 有 32 巧克力,她姐姐有 42. 如果他们吃了 35,,他们总共还剩下多少块?
A: Leah 有 32 巧克力,她姐姐有 42, 总共有 32 + 42 = 74 巧克力。他们吃了 35, 后,现在有 74 - 35 = 39 巧克力。 答案是 39.
问: Jason 有 20 棒棒糖。他给了丹尼一些棒棒糖。现在 Jason 有了 12 棒棒糖。杰森给了丹尼多少根棒棒糖?
A: Jason 一开始有 20 棒棒糖,但现在他只有 12, 所以他给了 Denny 20 - 12 = 8 棒棒糖。 答案是 8.
问: 肖恩有五个玩具。圣诞节时,他从爸爸妈妈那里各收到了两个玩具。他现在有多少个玩具?
A: Shawn 从他的妈妈和爸爸那里得到了 2 玩具,所以他得到了 2 * 2 = 4 更多,现在他将有 5 + 4 = 9玩具. 答案是9.
问: 服务器机房有九台计算机。从周一到周四,每天都会安装五台计算机。服务器机房现在有多少台计算机?
A: 周一至周四安装了 5 计算机,因此总共安装了 5 * 4 = 20 计算机。开始时有 9 计算机,所以现在有 20 + 9 = 29 计算机。 答案是 29.
问: 迈克尔有 58 高尔夫球。周二,他丢失了 23 高尔夫球。周三,他又失去了2。星期三结束时他有多少个高尔夫球?
A: Michael 从 58 高尔夫球开始,失去了 23,,所以他有 58 - 23 = 35. 在他失去 2 后,他有 35 - 2 = 33 现在有球了。 答案是 33.
问: Olivia 有 $23。她以每个 $3 的价格买了五个贝果。她还剩多少钱?
答: 五个贝果每个 $3,共需 5 * 3 = 15 美元。Olivia 原有 $23,因此还剩 23 - 15 = 8 美元。 答案是 8。

完整的思维链的少样本提示了数学应用题。这些范例与 12 中的相同,只是思维链是由不同的标注者(“标注者 B”而不是“标注者 A”)编写的。标注者是共同作者,熟悉思维链提示的目标。

数学应用题提示
问: 树林里有 15 树。树林里的工人今天将在树林里植树。完成后,就会有21树。今天果园工人种了多少棵树?
A: 我们从 15 树开始。后来我们有了 21 树。差别一定是他们种植的树的数量。所以,他们一定种了21 - 15 = 6 树。 答案是6.
问: 如果停车场有 3 车,还有 2 车到达,那么停车场有多少辆车?
A: 停车场已有 3 车。 2 更多到货。现在有3 + 2 = 5 车。 答案是5.
问: Leah 有 32 巧克力,她姐姐有 42. 如果他们吃了 35,,他们总共还剩下多少块?
A: Leah 有 32 巧克力,Leah 的妹妹有 42. 这意味着最初有 32 + 42 = 74 巧克力。 35 已被吃掉。所以总共他们还有 74 - 35 = 39 巧克力。 答案是 39.
问: Jason 有 20 棒棒糖。他给了丹尼一些棒棒糖。现在 Jason 有了 12 棒棒糖。杰森给了丹尼多少根棒棒糖?
答: Jason 吃了 20 棒棒糖。既然他现在只有12,那么他肯定把剩下的都给了丹尼。他给丹尼的棒棒糖数量一定是 20 - 12 = 8 棒棒糖。 答案是 8.
问: 肖恩有五个玩具。圣诞节时,他从爸爸妈妈那里各收到了两个玩具。他现在有多少个玩具?
答: 他有5玩具。他从妈妈那里得到了 2,所以之后他就有了 5 + 2 = 7 玩具。然后他从爸爸那里得到了更多的2,所以他总共有7 + 2 = 9 玩具。 答案是9.
问: 服务器机房有九台计算机。从周一到周四,每天都会安装五台计算机。服务器机房现在有多少台计算机?
答: 周一到周四有 4 天。 5 计算机每天都会添加。这意味着总共添加了 4 * 5 = 20 计算机。最初有 9 计算机,所以现在有 9 + 20 = 29 计算机。 答案是 29.
问: 迈克尔有 58 高尔夫球。周二,他丢失了 23 高尔夫球。周三,他又失去了2。星期三结束时他有多少个高尔夫球?
A: Michael 最初有 58 球。他在周二输掉了 23,因此此后他有 58 - 23 = 35 球。周三他失去了更多的 2,所以现在他有 35 - 2 = 33 球。 答案是 33.
问: Olivia 有 $23。她以每个 $3 的价格买了五个贝果。她还剩多少钱?
答: 她以每个 $3 的价格买了 5 个贝果,因此一共花费 5 * $3 = $15。她原有 $23,所以现在还剩 $23 - $15 = $8。 答案是 8。

完整的思维链的少样本提示了数学应用题。这些范例与 12 中的相同,只是思维链是由不同的标注者(“标注者 C”而不是“标注者 A”)编写的。

[^1]: 例如,原思维链使用多个短句:“最初有 9 台计算机。连续 4 天,每天增加 5 台。因此新增 5 * 4 = 20 台;9 + 20 = 29 台。”简洁版本则写作:“新增 5 * 4 = 20 台,因此服务器机房现在有 9 + 20 = 29 台计算机。”

[^2]: 我们采样不超过 60 个词元的示例,以适应输入上下文窗口;同时将解题步骤限制在不超过 2 步,以便与手工编写的八个示例公平比较。

[^3]: 我们用 GPT-3 davinci 测试了 10 个常见姓名,除一个外全部正确。

[^4]: 对于超过 2 个单词的姓名,我们会拼接多个名字和姓氏。

━━━ fin ━━━

If you read this far — thank you.
Come tell me what you thought on X.