可计算的 AI writing——LLM 时代下的本格推理小说创作理论与实践

2026.08

一、AI writing 与 AI coding 的对比

同样是大模型的应用,AI coding 与 AI writing 到 2026 年 8 月已经拉开了明显的差距。

维度AI codingAI writing
目标正确性有客观标准:能编译、过测试即对无统一裁判:好与坏依赖人的判断
验证手段可自动执行(compiler)只能由人阅读后评价
反馈闭环agent 可自主"写—跑—改"循环反馈稀疏、主观,难以自动闭环
基准与度量HumanEval、SWE-bench 等公认基准缺乏公认的质量基准
强化学习奖励信号明确,可大规模 RL奖励模型本身就不可靠
当前形态已能独立完成中等规模工程任务以辅助、局部生成、润色为主

造成差距的主要原因:代码是可计算、可验证的——它有可执行的语义和客观的验证流程;文学的标准往往并不明确,"好"本身无法被编译。

但在所有文学品类里,有一类作品有些接近这种"可计算、可验证"的模式——本格推理


二、本格推理小说"逻辑"的拆解与形式化

本格推理(honkaku mystery)是一个非常细分的文体。不同于变格推理(以猎奇、恐怖、心理异常为趣味)与社会派推理(以犯罪的社会成因、社会批判为重心),本格推理以"逻辑解谜"为小说的首要趣味:关注点在于诡计如何构成,以及侦探如何将有限的线索排列重组,从而"推导"出真相;文学性相对次要,甚至可以牺牲。

本格的核心承诺是:谜团的解答必须可以由读者从文本给出的信息中逻辑地推出。我们先介绍几个本格推理的核心概念。

fair play:本格推理的核心契约,含义是双面的:

范达因二十则(S.S. Van Dine, 1928)诺克斯十诫(Ronald Knox, 1929)
1. 读者必须与侦探拥有同等的破案机会:所有线索都须明确陈述与描述1. 凶手必须在故事前段登场,但不能是读者被允许追随其思绪的人物
2. 除罪犯对侦探本人实施的欺骗外,不得对读者耍任何花招2. 禁止使用超自然力量
3. 不得有恋爱线:任务是送罪犯上法庭,不是送情侣上神坛3. 密室或暗道最多只能有一个
4. 侦探本人或官方调查者不能是凶手4. 禁用世上未发现的毒药,以及需要长篇科学解释的机关装置
5. 凶手只能由逻辑推理确定——不准靠意外、巧合或无动机的自首5. 不得有中国人角色登场
6. 必须有真正的侦探:侦探的职责是搜集线索并加以推断,否则不成其为侦探6. 侦探不得靠意外相助,也不得有"莫名其妙但事后证明正确"的直觉
7. 必须有尸体:谋杀以下的轻罪不配做侦探小说的谜面7. 侦探本人不得犯罪
8. 破案必须严格用自然主义手段:禁止通灵、降神会、读心术8. 侦探发现的每条线索,必须即刻呈现给读者检视
9. 只能有一个侦探——推理主角唯一9. "华生"型助手不得隐瞒自己的任何想法;其智力须略低于普通读者
10. 凶手必须是故事中戏份相当的人物10. 双胞胎与替身不得出现,除非事先做了充分铺垫
11. 仆人(管家等)不得选为凶手——这太偷懒
12. 无论发生多少起谋杀,元凶只能有一个(可有共犯,但全部罪责归于一人)
13. 秘密结社、黑手党式犯罪组织不得登场
14. 杀人手法与破案手段必须理性、科学
15. 真相必须始终"可见"——只要读者足够敏锐;重读时所有线索都早已在场
16. 不得有冗长的描写段落、文学性闲笔与细腻的性格分析
17. 职业罪犯不得被安上罪责
18. 案件不得最终以意外事故或自杀收场
19. 动机必须个人化——不写国际阴谋与政治秘谋
20. 禁用桥段清单:烟蒂比对、假降神会、伪造指纹、假人偶制造不在场证明、"不叫的狗"、未铺垫的替身、注射迷药、警察破门后才布置的密室、词语联想测罪、侦探最后才破译的密码信

谜面的三个经典问题:

围绕 whodunit:

red herring(红鲱鱼):故意投放的误导性线索,将怀疑引向无辜者。合格的红鲱鱼必须"事后可解释"——揭晓后读者能明白它为什么天然可疑。

围绕 howdunit:

impossible crime(不可能犯罪):表面上物理上不可能的犯罪,其下最著名的子类型是密室杀人(locked-room mystery)。在出现不可能犯罪的本格小说中,howdunit 是最核心的谜面。也常出现 whodunit 很好猜、howdunit 极难猜的情况。

ALIBI(不在场证明):嫌疑人声称案发时自己位于他处、从而不可能作案的证明。破解 alibi 是本格的核心子类型,其逻辑本质是对物理可能性(时空约束)的推理。破解方式无非三类——证词造假、时间被伪造(如拨快/拨慢时钟、录音伪装存活时刻)、空间被压缩(凶手实际移动得比所有人以为的快)。

2.1 形式化

对很多本格小说而言,whodunit 都是核心谜题,可以用一个形式化的方式描述。设故事为段落序列,并引入概率论中信息流(filtration)的视角:

$$X = (x_1, x_2, \dots, x_L), \qquad \mathcal{F}_i = \sigma(x_1, \dots, x_i)$$

其中 $\mathcal{F}_i$ 表示"读到第 $i$ 段为止可获得的一切信息"。谜题的核心是一个隐藏变量 $Y$(凶手身份),取值于嫌疑人集合 $\mathcal{Y}$,其中含真凶 $y^{*} \in \mathcal{Y}$ ,也可能包含至少一个幌子 $\bar{y} \in \mathcal{Y}$。

读者模型 $M$ 是一个关于 $\{\mathcal{F}_i\}$ 的适应过程

$$M(i) \;=\; p\bigl(Y = \cdot \,\big|\, \mathcal{F}_i\bigr) \;\in\; \Delta^{|\mathcal{Y}|-1}$$

即读到第 $i$ 段时,该读者对"谁是凶手"的概率估计;其 argmax 就是"该读者此刻猜的凶手":$\hat{y}_M(i) = \arg\max_{y \in \mathcal{Y}} M(i)_y$。

这个视角下有一个漂亮的对应:理想读者(贝叶斯最优推断者)的估计过程是关于 $Y$ 的鞅——由于故事最终会揭示真相($Y$ 关于 $\mathcal{F}_L$ 可测),依鞅收敛定理,$M(i) \to \delta_{y^{*}}$(概率质量最终收敛到真凶);而"线索充分"对应的是:这个收敛在揭示点之前就已完成。于是一个故事的"可解性"可以被刻画为:这个鞅向真值收敛得又多快、又多稳。天真读者则是一个被红鲱鱼牵引的次优推断器——理想情况下,它的概率质量应流向幌子 $\bar{y}$ 而非真凶。

whodunit 之外,howdunit 可以形式化吗? 可以类比着做。此时隐藏变量 $Y$ 不再是有限嫌疑人集合上的分类变量,而是"手法"这样一个结构化对象(一套时空安排)。一个自然的刻画是把密室建模为约束满足问题:在前读阶段,读者眼中的约束系统看似不可满足——这就是"不可能"感的来源;而解答的本质是揭示某个被默认的隐含约束其实并不成立(时间被伪造、空间被压缩、证词造假——正好对应上文的三种 alibi 破解),系统由此恢复可满足。

挑战读者(Challenge to the Reader):埃勒里·奎因(代表作有《希腊棺材之谜》以及《X 的悲剧》等)的发明——在解答章之前插入一页,直接向读者宣布此刻全部线索已齐备,把 fair play 从隐含契约变成明示赌约。也就是说,到这一页为止,读者手里的线索是充分的:理论上可以据此推出凶手是谁、行凶手法与诡计是什么。


三、诠释学的框架

彼得·休恩(Peter Hühn)The Detective as Reader: Narrativity and Reading Concepts in Detective Fiction(1987)——侦探小说叙事学被引最多的文献之一(300+ 次)。它第一次把破案完整地重新描述为一种阅读行为

由此得到一个逐级嵌套的"写—读"结构:

罪犯(写现场)→ 侦探(读现场 / 写解答)→ 叙述者(写侦查)→ 读者(读侦查 / 重复侦探的读)

注意最右端:真实读者重复侦探的诠释活动——读者也在猜凶手。于是文本内外形成两场平行的竞赛:

作者必须给出真线索(fair),同时必须成功误导(play)。


四、信息论形式化

Wagner, Keydar & Abend(耶路撒冷希伯来大学)The Challenge and Reward of Fair Play in Narrative: A Computational Approach(2025)——把休恩的诠释学直觉翻译成可计算的概率模型,并实测大语言模型(LLM)写推理小说的能力边界。

最重要的是提出了读者模型。四类理想读者,按"信息权限 × 推理能力"两轴定位:

4.1 两个分数与一条定理

先定义基准量——读者 $M$ 在一篇故事上的预测准确率

$$A(M) \;=\; \frac{1}{L} \sum_{i=1}^{L} \mathbb{1}\bigl[\hat{y}_M(i) = y^{*}\bigr]$$

即"全程 $L$ 个位置中,猜中真凶的位置占比"。在此基础上:

中心定理(意外—连贯权衡):对任何单一读者模型,意外与连贯必然此消彼长——严格按线索理性更新信念的读者,不可能同时被结局震惊。两者要同时成立,必须制造后见之明落差(hindsight gap):读者在揭示瞬间从"前读模式"(被骗)切换到"回望模式"(原来如此)。"啊哈时刻" = 解释状态的相变。

推论(长度困难):故事越长,维持 fair play 越难——要么线索稀薄得剧情像没推进,要么误导工程量爆炸。

三种故事原型由此各就各位:机械降神(有意外无连贯)、非谜故事(有连贯无意外)、公平游戏(靠 hindsight gap 两者兼得)。

4.2 实操构造:怎么"造"出这些读者

天才读者与全知读者的桥梁是"线索充分性"(clue sufficiency):若仅凭文本内部线索的最优推断就能逼近全知读者的判断,则 $M_1 \approx M^{*}$——这正是"公平"的精确含义:读者不必认识作者,光靠书里写的就能破案。反例:若某模型写十篇故事、凶手十篇是管家,全知读者第一段就锁定管家(连贯分虚高),而天才读者从文本里推不出来——高分掩盖了无线索的作弊。

4.3 实验结论(对"AI 写推理"的直接裁决)


五、LLM 时代下的本格推理创作

以下内容没有什么文献参考,多为 LLM 时代下的经验之谈。

5.1 模组化

模组化命题:在严格限定下(绝对公平、唯一真解答、无叙诡无 meta、侦探中立、全员理性、有限时空、谋杀核心),古典本格的最终解答逻辑链可以被 AI 系统无限模组化;并且,人类与 AI agent 可以用明确的语言、公式或图论把这种模组化说清楚

回到休恩的诠释学框架:此处的工程化建模必须同时包含两层——逻辑链的模组化(文本内:罪犯 vs 侦探,欺骗与破译),以及 fair play 的模组化(文本外:作者 vs 读者,误导与识破)。

连贯性一侧:

意外性一侧:

5.2 仍旧面临的问题


六、实证研究

回到开篇的问题:AI writing 与 AI coding 的差距,在于文学缺少验证器。前面的工作已经部分弥补了这一点:形式化给出了读者模型与打分机制,模组化把逻辑链变成了可登记、可校验的工程对象。剩下的一步,是为创作过程手工造出一套验证体系——规约(真相档案)+测试套件(机器探针)+ code review(独立评审)+用户测试(盲读)。以下按体量分短篇与长篇两套工作流。

6.1 短篇创作工作流

适用于单核心诡计、至多双案件耦合的作品。在此体量下,配合正确的工作流,目前最强的 AI agent 已能从头到尾完成得相当好;人要守的是流程关口。必需项如下:

  1. 真相档案先行(truth-first)。动笔前先锁定唯一事实源,其中三本台账分开登记:凶手视角的真实时间线、侦探视角的发现层台账(每步从哪些材料推出什么结论)、读者认知版时间线(与真实版逐行对照)。任何修改都先改档案、再改正文、再跑校验,顺序不可颠倒。它对应 hindsight gap 的工程化:意外与连贯的双目标只能从终点反向设计;认知版与真实版的对照,即天真读者与聪明读者落差的建模。
  2. 复杂度预算。互锁锚点控制在个位数(每多一个,交叉验证成本近似平方增长);物理动作链每条不超过三步;优先解释层诡计(替换证据含义,而非增加物理动作——相比让 AI 脑内推演密室机关,仅靠文字的叙述型诡计目前更容易实操),即"长度困难推论"在可控规模内的应对。
  3. 锚点推算表、线索台账与发现层台账。时间点写明推算规则并用代码逐条实算,禁止心算;线索登记埋设/回响/回收三态,解答章不得首次引入新物证;推理节点写明结论、依据清单、是否"读者在场材料",写不出依据清单的节点就是设计洞。三件事分别对应:连贯性一侧可校验、"聪明读者清单"的台账化、可解性判据(聪明读者必须优于瞎猜)。
  4. 机器探针。每轮修订后跑脚本检查:陈旧字符串零命中(改稿漂移是最高发的 bug 类别)、锚点旧值零命中、引号配对、字数一律脚本实测回写。这一步把修订从文学行为变成了有回归测试的工程行为。
  5. 独立双人评审。逻辑/时间线审查员与文风审查员并行、互不可见;评审必须独立于执笔者——知道真相的人最难假装不知道。这对应双读者校验:逻辑审查员扮演聪明读者,文风审查员兼负天真读者的部分职能。

经验结论一条:实际工作流中,审查花的时间一定多于写作,这是对的成本结构。

6.2 长篇创作工作流

长篇会正面撞上 5.2 节的复杂度爆炸,但也只有长篇容得下多案件耦合、多嫌疑人多重解答乃至元结构创新。代价是人必须在 plan 阶段深入参与:完整大纲多轮 review,真相档案每行由人裁决;AI 负责产出与修复,人负责挑错与裁决。在短篇工作流基础上需额外补充:

  1. 复杂度不设上限,但保险强制配对。锚点全部进表、逐条实算;动作链按时间窗切段,逐段给出耗时估算、窗口余量与失败模式;多诡计叠加时画依赖图(哪个诡计以另一个为前提),防止改一处塌一片。
  2. 高回收密度章节的事实提取表。自白章、对峙章、解答章动笔前,把要回收的每条线索、每句台词逐字摘录并注明出处,禁止凭记忆复述。它是"改稿漂移"在高密度章节的对症药:凭记忆回收是引文错位的主要来源。

6.3 AI 创作的小说与本格名著的差异

《谋杀歌谣》

《烧却告白》

《如首无作祟之物》


参考文献

  1. Peter Hühn, "The Detective as Reader: Narrativity and Reading Concepts in Detective Fiction," MFS Modern Fiction Studies 33(3), 1987: 451–466. https://muse.jhu.edu/article/244364
  2. Eitan Wagner, Renana Keydar, Omri Abend, "The Challenge and Reward of Fair Play in Narrative: A Computational Approach," arXiv:2507.13841. https://arxiv.org/abs/2507.13841
  3. 豆瓣笔记:《为什么埃勒里·奎因可以被AI取代——"现代的逻辑流"何以可能》,https://www.douban.com/note/854874505/