为什么创意写作对齐需要专家判断数据

Community Article
Published July 26, 2026

English version: Why Creative Writing Alignment Needs Expert Decision Data

一场关于“好写作”的争论

大语言模型的创意写作到底有多难?发生在 OpenAI CEO身上的一件小事,可能能帮我们直观地感受到。

2025 年 3 月, Sam Altman 在 X 上写道,他们训练了一个擅长创意写作的新模型。他说,这是第一次,AI 写出的东西真正让他“受到触动”;在他看来,那段文本准确写出了元小说的气质。他还晒出了模型根据提示写出的短篇。Altman 的原帖

一位 X 用户在评论里写道:“I would encourage you to read some actual writing before declaring this good writing.”他获得了3000多个赞。 后来《纽约客》回顾这段插曲时,概括道:似乎没有人像 Altman 本人一样被那段文本打动。《纽约客》的回顾

这不是审美路线的问题,而是现在LLM 进行的创意写作都还没有到优秀作家的水平。

LLM写的故事,比以前更长了,更连贯了,更流畅了,用词也更准确了。但是在人物魅力、情感冲击、故事张力上依然一塌糊涂。

它做得好的,主要是容易规模化测量的成品属性。它做得不好的,往往是那些难以被一般人准确表达、难以规模化标注,也很难从成品中反推出其形成过程的创作判断。让优秀作家区别于普通人、区别于平庸作家的,正是这些很难被直接说清的隐性判断。

要让 LLM 学会像人类专家一样作出这些创作判断,重要的一步是获得人类专家对于创意写作的判断样本。

很可惜,在人类世界里,这类东西太少了。在法律、金融、生物医药等领域,专业判断会以案例、裁判、研究报告、诊疗指南等形式留下大量记录。创意写作领域看起来有海量作品的评论,但很遗憾这不是我们谈的“创意写作的判断样本”。

在这里,我需要特地说明一下:绝大多数大众书评是一种“判断的文本”,但更接近“消费品体验报告”,它更多呈现的是阅读者从作品中读到了什么。少数专业评论当然会深入结构和技法,但通常也不会留下创作者面对具体问题时比较过哪些方案、为什么选择 A 而放弃 B,以及判断如何在反例和修正中形成。人类世界并不缺少对作品的评价,真正稀缺的是创作决策本身留下的记录。

滑稽的是,LLM 其实连故事评论也写不好,尽管它们在训练时吞下了大量的人类专业评论。在有阅读审美的人看来,LLM 现在写的书评,还停留在“表演评论”的范畴。

如果我们希望 LLM 不只会评价写出来的东西,而是在创作阶段本身取得进步,它需要学习的,正是关于创作决策的专家判断样本。这就形成了一个现实困境,LLM 很需要这类数据样本,但是现实世界里又很少。

在我们回答这个问题之前,先回顾一下现状。

当创作决策不可见,训练只能先从结果入手

创作决策样本如此稀缺,过去几年,业界实际上使用什么信号来训练和改进创意写作?

答案是先从能够看见和量化的结果入手:让模型学习成品文本,用大纲、结构和格式约束生成,再通过人类偏好或 reward model,从几个已经写出来的版本中选择更好的一个。

这些方法取得了实质进步。模型写得更长、更连贯,也更能遵守明确的指令。Dramatron 等工具把模型带进了专业编剧的共创流程;RLMR 等最新研究也开始同时优化主观写作质量与字数、格式等客观约束。

但这些信号仍然主要围绕可观察的结果和预设的中间结构。它们可以约束、检查、评分或选择生成内容,却不会自动留下专业创作者当时看见了什么问题、比较过哪些方案,以及为什么改变判断。

从“哪个更好”到“为什么这样写”

结果侧信号与创作决策数据之间,到底差了什么?

我们提供的 CQA 公开预览数据集中,有一个问题:为什么有些人物困境会让读者多年后仍然记得,而有些看似激烈的冲突很快就失去说服力?

两位人类专家在交谈中,提及了一个失败的警察角色,他明明可以用合法、专业的方式推进调查,却偏偏采用不必要的非法手段,给自己制造了本来不存在的阻力。专家最初指出:这个故事的压力不是处境产生的,而是人物主动制造的。

另一位参与者随即把这个判断压缩成一句更直白的话:

“等于是这个角色主动把麻烦制造出来,然后再去解决。”

但判断没有停在“人物不要犯傻”这个浅层结论上。接下来的对比把真正的条件挖了出来:另一个故事里的一个警察同时背负父亲、办案人员和公务员三重身份。规则、家庭责任和职业责任彼此冲突,他已经尽力想让所有人都好,却仍然不可能全身而退。对话由此收束出一条更准确的原则:

能被读者记住的冲突,通常不是因为事情闹得大,而是人物真的被逼到了难以两全的位置。角色无论怎么选都要付出代价,冲突才会显得属于这个人物,而不是作者临时制造的障碍。

这条原则本身当然有价值,但 CQA 想提供的不只是结论。它还留下了结论是怎样形成的:先识别一处失败设计,追问压力究竟从哪里来,再用一个成立的反例修正最初的判断,最后才分清“人物主动制造麻烦”与“人物被多重责任挤压”之间的差别。

如果把这段材料改造成一条只保留选择结果的偏好数据,它可以告诉模型,读者更认可后一个警察的故事。这样的专家判断数据则进一步揭示:它为什么更好,判断在什么条件下成立,以及另外一个故事里的创作决策为什么不行。这正是从“哪个更好”到“为什么这样写”的距离。

CQA:让专家创作判断成为可学习的数据

CQA(Creative Quality Alignment)是我们提出的创意写作对齐体系。它当前完成的第一项工作,是从专业创作者大量依赖直觉、通常不会被主动言明的创作经验中,持续追问并挖掘出专家作出判断的依据,再把这个过程整理成可检查、可学习的数据。每条数据以具体的创作问题为中心,同时呈现专家判断如何展开,以及这些判断最后收束出的创作原则。

当前公开样本采用“聚焦问题、双专家对谈与最终回答”的表示形式,让读者可以完整检查判断展开的过程。但专家对谈并不天然只对应一种训练格式:其中的比较、误解修正、因果辨析和原则抽象,可以被保存在统一的母数据结构中,再根据不同研究目标导出相应的训练与评估视图。

这不只是一个数据概念。我们已经采集了 104 条中文创意写作专家知识材料,并将其中 4 条完成深度清洗、整理为公开预览。在此基础上,我们进一步提出:这种专家过程信号可能导向更优秀的模型创意写作能力。

但我们还不能声称它已经证明了这种能力。这类数据经过训练后,是否会在人物、冲突、线索、节奏、原创性和叙事张力等维度产生可复现的提升,仍然需要训练实验、合理基线和专业评测来回答。

我们已经在 Hugging Face 上公开了 CQA: Creative Quality Alignment for Creative Writing Expert CoT (Preview) 的 4 条完整预览样本。它们来自目前已采集的 104 条中文创意写作专家知识材料。如果你正在研究 creative writing post-training、专家过程数据或创意写作评测,欢迎查看这些公开样本并与我们交流。针对进一步的研究与应用,我们提供未公开材料的进一步清洗与授权合作,以及围绕具体模型目标的定制数据生产服务。

Community

Sign up or log in to comment