跳转至

参考来源

本文件是 qu-ai-wei 的 sources / philosophy reference。SKILL.md 在第零步 / 第一步不读此文件;遇到需要追溯规则出处、年度刷新流行语、核对哲学根基时,再按需读取。

中文写作哲学根基

  • 叶圣陶「写话」主张 — 出自叶圣陶《作文论》(1924 年,商务印书馆)与叶圣陶 · 夏丏尊《文心》(1934 年,开明书店)。核心两句:"写出来的话要跟嘴里说的一样"、"说自己的话"。反对八股作文腔、空话套话。本 skill 的"AI 味 = 不说人话"定位,本质上是叶圣陶"写话"主张的当代投射 —— 相差 70 多年,反对的是同一件事:模仿规范而生的空腔。叶给的是哲学根基,humanizer 给的是工作流骨架。

叶圣陶 / 夏丏尊《文心》(1934):"我们要写出自己要说的话,不要借用别人的调子。"

通用 AI 腔分类

通用分类(过度拔高、模糊归因、rule of three、同义词轮换、宣传腔、填充、谄媚、客服腔等)参考自英文 Wikipedia: Signs of AI writing(由 WikiProject AI Cleanup 维护)。中文维基也有一份社群协作的平行条目 维基百科:AI生成文的特徵(与英文版独立,不是翻译),含中文具体实例,可作交叉参考。

汉语语法依据

  • 吕叔湘《现代汉语八百词》(商务印书馆)— 现代汉语虚词用法权威
  • 朱德熙《语法讲义》(商务印书馆)— 现代汉语句法结构权威
  • 中文维基百科 汉语语法 — 综述性参考(基本语序 SVO、话题优先、不完全主谓句、助词 的 / 地 / 得 分工、缺乏印欧语屈折变化)

现代汉语经验基线(语料库)

诚实声明: 本 skill 至 v0.7.1 为止的所有规则、白名单、改后样例,都不是通过查询下列语料库逐条验证得出的,而是基于对 LLM 中文输出的人工观察 + 文献参考(吕叔湘 / 朱德熙 / 叶圣陶 / GB/T 15834-2011)整理。下列语料库是推荐的兜底验证源,等具体规则或边缘表达拿不准时,作者 / 贡献者应去查证;后续版本若把语料库证据正式纳入规则,会在 CHANGELOG 里点名某一条规则用了哪条 CCL / BCC 证据。

  • 北京大学 CCL 现代汉语语料库 — 网络版 https://corpus.pku.edu.cn/ ;旧版 http://ccl.pku.edu.cn:8080/ccl_corpus/ 。由北京大学中国语言学研究中心(Center for Chinese Linguistics)研制,纯学术非营利。
  • 规模: 现代汉语约 6 亿字符,涵盖文学、戏剧、报刊、翻译作品、网络语料、应用文、电视电影、学术文献、史传、相声小品、口语等多个语体。
  • 检索功能: 普通查询、模式查询、搭配查询(collocation)、批量查询、限定范围查询、频次统计、结果下载。CCL 是生语料库(未做分词 / 词性标注),以字符 / 字符串为索引单位。
  • 怎么用来反向验证一处改写:
    1. 频率验证 — 把改写后的短语放进 CCL 搜一下;命中很少 + 类似真人写法命中很多 → 改写引入了新生 / 翻译腔表达,回去用真人那种写法。
    2. 搭配验证 — 用搭配查询看某个动词在真人写作里跟哪些名词共现。比如 赋能 的高频共现在哪类语体、跟哪些名词搭配,可以量化"商务僵尸词"的判据。
    3. 语体验证 — CCL 子库分文学 / 报刊 / 学术 / 口语等。同一个词在不同子库的密度差,正好对应本 skill 的 9 语体矩阵。
  • 跟 BCC(北京语言大学)的区别: BCC 是熟语料库(分词 + 词性标注),提供历时检索与部分统计;CCL 规模大、可下载全部结果、模式查询灵活。两者互补:复杂搭配 / 词性约束的查询走 BCC,大规模频次 / 字符串模式查询走 CCL。

标点规范

  • 中华人民共和国国家标准《标点符号用法》GB/T 15834-2011 — 中文标点的国家强制标准
  • 本 skill 的「标点符号」章节以该国标为准。注意 GB/T 15834 并未规定中英文之间必须加空格,中英空格(盘古之白)是排版偏好,本 skill 不管

中文 AI 腔观察者

  • yage.ai《写作中的 AI 味是哪儿来的》 — 原创观察文章,主张"AI 味 = 翻译腔"。模式 #39(思考过程里的物理动作动词)、#40("X 很 Y:" 形容词+冒号起手式)、#41(抽象名词主语 + 形容词收尾)、#42(有中文译法却留着的英文单词) 的核心观察来自这篇文章。文章的"归化式思维"(覆盖原文,用中文重新说一遍)主张与本 skill「避免过度修正五问」的反向翻译验证精神相通。

语言时效性锚点

  • 《咬文嚼字》(上海文艺出版总社主办月刊,1995 年创刊)— 每年 12 月发布「十大流行语」、次年 1 月发布「十大语文差错」,是现代汉语流行语 / 语文错误的权威社会语言学观察。本 skill 规则 #49(网络流行语机械套用)的「鲜活词」与「已入土词」清单每年按《咬文嚼字》榜单校准
  • 2024 十大流行语:数智化、智能向善、未来产业、city 不 city、硬控、水灵灵地 xx、班味、松弛感、银发力量、小孩哥 / 小孩姐
  • 2025 十大流行语:韧性、具身智能、苏超、赛博对账、数字游民、谷子、预制 xx、活人感、xx 基础 / xx 不基础、从从容容游刃有余 / 匆忙忙连滚带爬
  • 年度刷新机制:每年 12 月《咬文嚼字》十大流行语发布、次年 1 月十大语文差错发布后,把新词加入本节「官方榜单」行;把 3 年以上未进榜、社群已不再使用的旧词下沉到「已入土」行。刷新同步打到 SKILL.md / references/platform-patterns.md(#49 词表)/ .cursorrules / WARP.md / README.md,保持一致。

中文特有模式

中文特有的 AI 腔模式(的的不休、进行 + V、性 / 化 后缀堆叠、四字成语机械堆叠、赋能 / 助力 / 打造 词族、长破折号解释句、翻译腔残留、自媒体平台套路等)基于对 LLM 中文输出的观察整理。可交叉参考的中文社群资源:维基百科:AI生成文的特徵。欢迎补充、纠正、反馈。

Wikipedia 的关键洞察:"LLM 靠统计算法猜下一个 token 该是什么。结果会倾向于在最多场景下都适用的、最统计常见的那种说法。" (LLMs use statistical algorithms to guess what should come next. The result tends toward the most statistically likely result that applies to the widest variety of cases.)