Fragment

Creader Guardian - 叙事系统的验证层

T
timWorld Creator
April 2, 20264.1K words

很多时候人之所以没法去叙事,

不是因为想法的匮乏,而是掌控感的丢失

@Creader_io于v0.6.0发布至今已经有1个月之久,期间推出了一系列旨在展示产品基础能力的核心功能。尽管如此,该应用尚未达到我最初的预期。这种差距并不意外。产品设计往往始于我对用户行为的内部模型,而实际使用中常常暴露出意图与执行之间的偏差。与其将其视为失败,不如将其作为一个必要的反思契机。

本文聚焦于 Creader 的两大核心组件之一:Guardian 系统——我将其理解为一种叙事分类器。Guardian 的概念源于我在大量阅读网络文学作品过程中反复观察到的一种现象。在读者反馈和作者讨论中,一个模式反复出现:情节推进与角色行为的不连贯是最常见的不满来源之一。这些不连贯极少源于创意的不足,而是源于在不断演变的叙事中保持连贯性的困难。

Guardian 系统的构想正是为了填补这一空白。它的目的既非生成内容,也非取代作者的创造性角色。相反,我将其设计为通过两个主要功能提供结构性支持:依据既定知识库验证逻辑一致性,以及审核叙事在文本层面的连贯性。从这个意义上说,Guardian 作为一种持续验证机制运行,确保不断发展的叙事始终与其自身已设定的约束条件保持一致。

这种区分至关重要。许多现有的人工智能系统优先考虑内容生成,而 Guardian 关注的是保存——对逻辑、结构和叙事完整性的保存。写作,尤其是在长篇语境下的写作,不仅仅是一种创造行为,更是一个在不断复杂的系统中维持连贯性的持续过程。

最初的实现从三个维度进行叙事验证:风格、一致性和实体层面分析。风格分析侧重于提取风格特征,包括语调、叙事视角和时态。一致性验证确保角色行为、情节推进和风格连续性之间的对齐。实体层面分析则针对角色对话、行为以及事件层面的逻辑。这三个维度共同构成了 Guardian v0.1 的初始架构。

然而,在公开发布期间,Guardian 未能达到预期的效果。许多检测器存在缺陷或无法使用,且 CJK[1] 算法是错误的。例如,一位用户写了五个章节,系统反复提示重复名称的警告,而真正的叙事问题却未被检测到。这种检测与实际情况之间的错位使系统无法使用,并促使我对整个基础设施架构进行重新评估。我们的产品中最重要的差异化服务就是 Guardian;没有它,我们就无法推进 MCP 或叙事引擎。

Guardian V1

初始实现的失败揭示了一个关键限制:叙事分析不能依赖单一方法。基于规则的系统能够提供精确性,但缺乏解释深度;而模型驱动的方法则引入了可变性。Guardian V1 通过将多种分析来源整合到一个统一的系统中来解决这一问题。

其核心架构包含三个组件:基于知识库的实体注册表、确定性的表层分类器,以及通过语言模型进行的语义推理。这三个组件对应三种验证模式:

真理(知识库)→ 模式(规则)→ 推理(大语言模型)

每一层针对不同类别的问题。知识库依据既定的实体和时间线强制保持一致性。基于规则的层捕捉通过显性文本模式表达出的偏差,例如叙事视角的转换或时间上的不一致。语义层则评估更高层次的属性,包括连贯性、语调和叙事质量。

该架构以分阶段管道的形式实现。实体注册表首先根据知识库验证文本。确定性的分类器随后以高精度分析表层模式。结构分析将这一工作扩展到事件层面的连贯性和推进。最后,语义层应用基于模型的推理来捕获那些无法还原为规则的方面。

该系统本质上具有语言依赖性。叙事信号(如名称识别和对话结构)在不同语言之间存在差异,因此需要为英语和中文分别设计解析策略以保持准确性。该系统的主要灵感来源于 Chinese-novelist-skill [2]。

因此,Guardian V1 不应被理解为一个单一的分类器,而应被视为一个分层的验证系统。其作用是在不干扰作者创作过程的前提下,持续确保不断发展的叙事在逻辑上保持一致、在结构上连贯有序。

基准测试

为了评估 Guardian,目标是测试其在不同的文本形式中检测和分析叙事一致性、结构及文学质量的能力。这需要一个既具有明确定义的叙事结构,又能保留现实写作复杂性的基准测试。

为此,我们选择经典文学作为评估领域。这类作品具有成熟的叙事连贯性、人物塑造和结构完整性,使其成为基于规则和基于模型分析的合适参照点。我们选取了两部文本:英文的《哈姆雷特》和中文的《红楼梦》,从而能够在不同语言和文体风格下进行评估。

为了控制文本结构的差异,我们使用了两种类型的输入。第一种称为固定文本,由结构化且带有注释的内容组成,其中关键的叙事信号被显式表达。第二种是原始文本,保留了完整的文学形式,叙事元素隐式地嵌入在散文之中。这种区分使得我们能够在理想化条件与现实世界条件之间进行比较。

评估在多种分析模式下进行,包括局部基于规则的处理以及多个语言模型,例如 GPT-4o-mini、GPT-5.3、Claude Sonnet、Claude Opus 和 DeepSeek。这种设置使得系统不被视为一个单一的、依赖模型的解决方案,而是一个在不同推理机制下运行的混合架构。

分析器结构

评估框架由五个层级组成。前两层完全基于规则,其余层级则结合了确定性方法与语言模型推理。

第一层: 一致性验证

该层评估叙事内部的连贯性,包括实体属性、角色状态以及时间线的对齐。分析采用确定性规则对结构化输入进行处理,不使用语言模型。输入经过控制以最小化歧义,确保能够在不产生解释差异的情况下评估不一致性。性能通过精确率、召回率和假阳性率来衡量。

所有配置在该层均取得完美分数。这反映了该任务的确定性本质:明确定义的约束可以可靠地验证,无需语义推理。

第二层: 风格分析

该层评估文本的风格属性,包括句子变化、段落结构、修饰语使用、叙事铺陈以及背景密度。分析采用确定性分类器捕捉表层语言模式,不依赖语言模型。性能通过执行健全性和抗假阳性能力来衡量。

所有配置在该层均取得满分,表明分类器运行可靠且不会引入虚假检测。固定文本与原始文本之间存在一致的差异。原始文本表现出更高的句子变化率和更复杂的句法结构。扩展段落结构主要出现在原始文本中,尤其是《红楼梦》,反映了对较长叙事段落的偏好。原始文本中的背景密度也更高,如《哈姆雷特》所示,描述性语境嵌入在对话之中。

这些结果表明,虽然风格模式可以通过确定性方法可靠检测,但其分布在结构化文学形式与自然文学形式之间存在显著差异。

第三层: 质量分析

该层评估文本更高层次的文学属性,包括感知质量、角色弧线进程、因果连贯性以及结构缺陷的缺失。分析采用混合方法:确定性方法依赖文本内的显式证据匹配,而语言模型则提供语义解释以追踪叙事进程并评估定性属性。

性能从四个维度进行评估:检测质量、弧线映射、因果覆盖率和缺陷缺失。结果表明,确定性方法在质量检测和因果覆盖率上取得完美分数,反映了其在匹配显式文本信号方面的有效性。相比之下,基于模型的评估表现出显著差异,尤其在弧线映射方面。

在《红楼梦》中观察到显著差异。Claude Opus 未能检测到中文原文中的任何角色弧线节拍,反映了其严格的匹配策略——拒绝意译或语义等价的表达。GPT-4o-mini 和 GPT-5.3 通过允许更大的语义灵活性取得了中等性能,但在弧线排序和检测完整性上仍然存在错误。DeepSeek 实现了完全覆盖,可能源于其与中文文学数据更强的对齐能力。

这些结果表明,弧线映射并非纯粹的推理任务,而是语言对齐、叙事状态追踪和匹配容差度的函数。确定性方法确保显式案例的精确性,而基于模型的方法则引入可变性,具体取决于语义等价性的解释严格程度。

第四层: 悬念分析

该层评估章节层面的叙事张力,包括悬念的存在与否,以及跨角色、关系、时间和主线情节维度的叙事线索激活情况。分析结合了确定性分类与基于模型的解释:基于规则的方法检测悬念的结构信号,而语言模型用于解析歧义并减少对话密集或风格复杂段落中的假阳性。

性能基于分类器执行可靠性、悬念检测覆盖率、叙事线索激活情况以及虚假悬念信号的缺失进行评估。结果表明,确定性方法在具有密集疑问句或修辞结构的文本中倾向于过度检测悬念。这在《哈姆雷特》中尤为明显——疑问驱动的对话导致了多个虚假悬念检测。基于模型的评估通过过滤虚假信号显著改善了这一问题。

在评估的模型中,Claude Opus 表现出最强的性能,在所有测试案例中完全消除了假阳性。其他模型在不同程度上减少了虚假检测,但一致性较差。这些结果表明,悬念检测不能仅依赖表层模式。准确的分类需要解释性判断来区分真正的叙事张力与文体表达。

第五层: 结构分析

该层评估宏观层面的叙事结构,包括幕次分割、关键转折点以及长程叙事对齐。分析主要依赖基于模型的推理,因为这些任务需要理解跨扩展文本片段的关系。性能通过结构检测准确率和执行可靠性来衡量。

结果表明,语言模型持续优于基于规则的方法。在固定文本上,基于大语言模型的评估平均得分为95,而局部方法为82。在原始文本上,这一差距持续存在:76对66。中点、伏笔等结构元素通常是隐式的,无法仅通过表层模式捕捉。这表明,宏观层面的叙事结构本质上是一个语义问题,需要解释性推理而非确定性匹配。

固定文本与原始文本

固定文本和原始文本在评估中呈现出互补的特性。固定文本包含显式结构化的信号,这降低了解析复杂性,并提高了对角色的弧线、悬念和结构转换等元素的检测一致性。相比之下,原始文本保留了完整的叙事语境,这些信号隐式地嵌入在散文之中。这使得对因果关系和跨章节依赖关系的建模更加准确,但也增加了检测的难度。

因此,基于固定文本的评估产生更高的平均检测性能,而原始文本则提供了在自然写作条件下对系统能力的更真实评估。

模型比较

在所有评估中,Claude Opus 展现出最强的整体性能,与其他模型相比具有明显优势。然而,性能因领域而异。DeepSeek 在与中文文本的对齐上表现出更强的能力,而基于 GPT 的模型在长程结构分析中表现更为稳定。

这些结果表明,模型性能并非均匀一致,而是取决于语言对齐程度和任务特性,这强化了采用混合系统而非依赖单一模型的必要性。

结论

基准测试表明,没有任何单一模型能够在叙事分析的所有方面都足够胜任。尽管 Claude Opus 展现出最强的整体性能,但它并非在所有任务上都可靠,尤其是在角色弧线映射等任务中——更严格的匹配行为可能降低召回率。其他模型在特定条件下表现更佳,例如中文文学分析或长程结构解读。

同时,结果表明,基于规则的方法在由显式约束定义的任务中仍然非常有效。确定性分类器在一致性验证和表层风格分析等精确性比解释更重要的任务中表现出强劲的性能。然而,它们在情节结构和虚假悬念检测等任务中效果较差,因为这些任务需要系统区分表层信号与叙事含义。

这表明,叙事分析不应被框定为在规则与语言模型之间做出选择。更有效的方法是分层系统:确定性方法提供精度和稳定性,而语言模型处理歧义、上下文和长程语义结构。

基准测试还凸显了多语言评估的重要性。虽然《哈姆雷特》上的表现相对稳定,但《红楼梦》上出现了更大的差异,表明语言和文化的对齐仍然是影响模型行为的重要因素。

因此,Guardian V1 最好被理解为一个初始的验证框架,而非一个成熟的解决方案。其意义不仅在于分类器的性能,更在于为叙事系统奠定基础——使其能够从检测走向建议、引导,并最终实现更深层次的写作支持。

Guardian 不应被理解为一个模型,而应被理解为叙事系统的一个验证层。从这个意义上说,叙事系统需要验证层,正如软件系统需要编译器一样。

下一步计划

  • 纳入更多模型进行基准测试

  • 通过增加更多规则来改进分类器

  • 寻求支持更多语言

GitHub: https://github.com/timothyshen/narrative-bench