AI 味到底藏在哪?有人把 1.2 万篇博客拆成 214 个特征,发现它藏在文章结构里
AI 味到底藏在哪有人把 1.2 万篇博客拆成 214 个特征发现它藏在文章结构里上周 Hacker News 更新社区指南加了一条不要发 AI 生成或 AI 改写的评论理由是「HN 是人和人对话的地方」。这条规则帖拿到了 4229 分、1668 条评论是近两周最热的一帖指南原文、讨论帖。评论区的争吵很有代表性。一半人在欢呼另一半在反问同一句话你说它有 AI 味那你倒是说说味到底在哪这不是抬杠。现在的检测工具确实说不清。它们能给出一个分数但给不出解释。9 月 17 日更新到 v2 的一篇论文试着回答这个问题作者 Jochen Madler 把「AI 味」从用词层面往下挖了一层挖到了结构——信息怎么摆、按什么顺序摆、拿什么当证据、用什么口吻说SlopShape: Identifying AI-Generated Commercial Web ContentHTML 全文。结论一句话AI 写的文章输在「太整齐」。先说个尴尬的事实最好用的检测器改几个词就废了现在的 AI 文本检测主流是词级方法。微调过的编码器、文体统计、TF-IDF、零样本似然法四大类。在没被改过的文本上它们几乎完美。论文在同一批数据上复现了这套基线微调 ModernBERT 100.0文体统计 100.0TF-IDF 99.3。问题是「没被改过」这个前提太脆。零样本方法扛不住改写DetectGPT 在 1% 误报率下检测率从 70.3% 掉到 4.6%DetectGPT 原论文训练出来的分类器换个模型、换个领域就崩在被 AI 改写过文本上准确率可以低到 26%检测与反检测的军备竞赛整体上是防守方吃亏Can AI-Generated Text be Reliably Detected?靠「改写」来规避本身早就是一条成熟产业Paraphrasing evades detectors of AI-generated text。原因不复杂词级检测器读的是用词。而用词恰好是最容易改的东西。DeepSeek 这类模型把「首先/其次/综上」换成别的连词几乎零成本。换个层面不看用词看文章怎么组织信息论文的实验设计有点狠。一边是2250 篇 ChatGPT 发布之前的人类商业博客来自 268 个公司域名全部取自 2008–2022 年的 Wayback 存档——保证不是 AI 写的。另一边是11250 篇 AI 镜像让 5 个前沿模型照着同一份写作简报各写一篇。加起来 13500 篇文章全部用同一套仪器打分。仪器不是人手工列的是从人类文章里「长」出来的先由 LLM 从人类稿件里归纳出11 个维度目的、读者、结构与流程、解释方式、证据、声音、可操作性、商业信息植入、时效性、页面格式、写作风格在这个框架下发现457 个候选特征过一道质量门能否只凭文本回答、证据是否可定位、表述是否自解释砍掉 38.3%去重、聚类剩 266 个再做一道可靠性过滤答案几乎不变的删掉、答飞了的删掉、五次重复打分里飘的删掉又删 52 个。最后留下的仪器有214 个特征其中187 个是纯结构特征27 个是风格特征。风格被单独隔离出来就是为了证明后面所有结果都不是「用词」在起作用。打分是硬堆出来的13500 篇 × 11 个维度 148500 次 LLM 调用。98.0 分改写之后是 98.1 分先看最能说明问题的两个数字。只用 187 个结构特征在完全没见过的公司数据上区分「人写 / AI 写」macro-F1 是98.0。AI 稿件被模型自己逐段改写一遍平均 73% 的 13 词片段不再逐字重合之后同一套特征是98.1。几乎没动。1450 篇改写后的 AI 稿件里8 篇被判成人写改写前是 9 篇。五个模型单独看结果在 97.6–98.1 之间没有哪个模型靠改写逃掉了。对照组很说明问题只用 27 个风格特征88.1改写后掉到 87.1全部 214 个特征98.1改写后 97.9词级基线未改写文本上 100.0——但它只在未改写文本上成立。还有一个细节值得记一下结构模型和风格模型的错误集几乎不重叠。1740 篇测试集里结构模型错 19 篇风格模型错 101 篇两个都错的只有 4 篇。这说明两套特征测的不是同一件事结构信号是独立的。论文也不是没有防守。作者做了 8 项稳健性检查按公司切分数据集比原研究的随机切分更严避免公司文风泄漏、长度匹配后 98.1 不变、做 13-gram 记忆化检查只有 0.19% 的配对可疑剔除后 97.9、结构特征无法反推文章年份49.3等于瞎猜、去重阈值从 0.70 扫到 0.95 结论不变、去掉与测试集重叠的 11 个域名后 98.2、不同行业之间没有显著差异。那个「味」到底是什么10 个特征最精彩的部分在这里。论文把 187 个特征压缩到 10 个核心取值——只靠这 10 个特征仍然能到93.5 分。它们描述的是一篇「整齐的、自我宣告式的」博客文章结构特征取值哪一侧更多见人类-AI 差距结论行为结尾复述论点或重新包装AI0.650承诺位置出现在标题里AI0.624功能段清单有一节专门做总结/综合AI0.609外部参与路径缺席AI0.592旧时代 vs 现代对比无人类0.497首节之前先给论点无人类0.419风险/代价升级缺席人类0.362主叙述声音编辑部解释者口吻AI0.308篇幅档位短篇800 词以内人类0.274问题出现的位置靠后人类0.222按论文 Table 6 的指向整理标「AI」表示该取值在 AI 稿件里更常见。翻译成人话就是AI 会在标题里就把好处许给你——「如何把入职流程的耗时砍半」会在正文第一段宣布结构——「本文将讲清入职为什么会卡住、三个有效解法、以及怎么衡量差别」结尾再复述一遍论点——「总之结构化的入职流程能省时间」。人写的东西恰好相反不宣告目录不把论点摆在第一节前面不做「旧时代 vs 现代」的对比不加码风险结尾也不回头复述。而且人写得更短。听起来像废话但它的力量在于这几个特征是可以观察、可以指着原文说「你看这里」的不是黑箱里的一个分数。论文把这种形状命名为 tidy, self-announcing——整齐、自我宣告。人类在结构空间里是「离群点」如果把每篇文章的结构特征当成一个高维坐标点人类和 AI 会落在完全不同的地方。论文用「稀有度」来量化这件事看一篇结构和它最近的 25 个邻居平均有多远再换算成百分位。结构越少见稀有度越高。人类稿件平均稀有度0.838AI 稿件0.435差距 Cohen’s d 1.83原研究在小说上只有 0.83单靠稀有度排序就能分人机AUC 0.901最稀有的 1% 里人类 149 篇、AI 只有 4 篇同一道题1 篇人类 5 篇 AI里人类那篇是 6 篇中最罕见的占85.5%随机水平是 16.7%。也就是说**AI 不是写得不好是写得都差不多。**所有模型都往同样几个拥挤的结构区域里扎堆。甚至能认出是谁写的。六分类任务里人 5 个模型论文能把79.3%的稿件归到正确来源随机是 16.7%。人类稿件几乎不会被认错F1 0.966错的主要是 AI 认 AI——最难认的是DeepSeek V3.20.654而它恰好也是结构稀有度最高的 AI 模型0.547五个模型里最接近人类的 0.838。Claude 0.483、Gemini 0.461、Kimi 0.356、GPT 0.329。别忘了论文本身也是 LLM 打的分它怎么自证这类「用 LLM 当标注员」的研究最容易被质疑的是「你拿一个模型去评价另一堆模型凭什么信你」。论文的答案是把信度摆出来重复性同一批 60 篇文章独立打 5 遍分Krippendorff α 0.891两两 Cohen kappa 0.890逐项完全一致率 0.893人类金标注两名标注员独立对 12 篇文章、20 个特征打分每人 240 项人类之间 kappa0.928、人对模型0.946——比原研究的 0.739 / 0.839 更高改写的副作用被量化过改写让 15.6% 的特征答案改变而同一篇文本打两次分本身就有 10.7% 的差异——攻击确实有效只是散在各处没能把稿件推向人类那种结构轮廓作者还公开了 16 项与原研究的偏差登记deviation register连「语料只有原研究的 1/4.5」都写进去了。这一点很值得学习结论能不能站住取决于你愿不愿意把自己的测量误差先量出来。今日观点检测的意义不是抓人是认清「整齐」本身就是特征这篇论文最实用的地方不在检测器而在它给出的可操作清单。反过来读这张表你就知道为什么有些文章读起来「假」因为它在结构上太想让你满意了——标题先许诺开头先交代目录结尾再复述一遍。它没有跑题没有废话没有突然插进来的一句抱怨。而人类的稿件之所以在结构空间里散布得那么开恰恰因为人类的写作里塞满了不整齐的东西跑偏的一段、没被回答的问题、只有作者本人在意的细节。对做内容的人来说还有一层背景值得注意AI 搜索已经成为新的分发入口而 AI 引擎引用的来源和传统排名的前五名重叠只有 15–33%改网页内容对 AI 答案可见度的提升可高达 40%。当「被 AI 引用」变成一门生意GEO「长得像 AI 写的」这件事就会开始产生实际成本。最后一句提醒结构检测不等于判罪。词句可以重写结构可以刻意打散——但一份足够整齐到 98 分被认出来的稿子本来就说明它在说给你听之前已经先讨好过某个评测器了。参考来源SlopShape: Identifying AI-Generated Commercial Web ContentarXiv:2609.15369 · HTML 全文DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability CurvatureCan AI-Generated Text be Reliably Detected?Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defenseSpotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated TextSmarter, Better, Faster, Longer: A Modern Bidirectional EncoderModernBERTHacker News 社区指南不要发 AI 生成或 AI 改写的评论 · 讨论帖4229 分