准备上一篇比特币文章时,我先有一个很明确的想法:在法币供应可以扩张、购买力可能长期变化的背景下,比特币的固定供应规则,让它具有不同于美债和黄金的价值。
这个方向并不难写。只要把货币增发、2100 万枚上限、现货 ETP 和战略储备几件事连起来,很快就能得到一篇完整、流畅,也颇有说服力的文章。
真正费时间的,是回头检查这些话到底能说到哪里。
比特币“重新站上 8 万美元”,需要注明是哪一天看到的价格;货币供应增加,与物价上涨并不是即时、固定比例的关系;美国证券交易委员会批准现货比特币 ETP 上市,不等于监管机构推荐比特币;美国战略比特币储备的初始来源,是政府已经没收并持有的资产,也不能顺手改写成政府正在无上限买入。
这些区别都不大。有时只是补一个日期,保留一句限制,或者把“认可”改回“批准交易”。可少了它们,读者得到的判断就会完全不一样。
那次写作让我重新确认:AI 可以很快替我压缩资料,却不能替我完成理解。文字读起来越顺,我越容易忘记,里面有些桥梁可能是它自己搭上去的。
有链接,不等于这句话有证据
AI 总结现在经常会附上来源,这当然比没有来源好。但链接存在,只能证明有一个网页,并不能证明网页支持前面的整句话。
美国国家标准与技术研究院在生成式 AI 风险框架中,把模型自信地生成错误内容称为“confabulation”。这类错误不仅包括虚构事实,也可能包括看起来能够解释答案的错误逻辑和引用。NIST:生成式人工智能风险管理框架
来源本身可能是真的,问题出在它被怎样使用。
一份 SEC 文件说“批准现货比特币 ETP 上市交易”,总结可能把它写成“SEC 认可了比特币的投资价值”。前半句有文件支持,后半句却是额外加上去的判断。链接没有造假,结论仍然走远了。
OpenAI 自己的搜索使用说明也提醒,搜索结果和引用可能不完整、过时或不准确;准确性重要时,应打开来源,检查发布日期,并确认来源确实支持回答。OpenAI:如何检查搜索结果与引用
所以我现在核对引用,不再只看“有没有”,而是打开原文找那句话。然后看四个地方:时间、对象、适用范围,以及原文到底用了多重的语气。
找不到对应位置的链接,我先把它当作背景材料,不让它替结论背书。
总结最容易删掉的,恰好是边界
总结必然会省略。否则它就只是把原文重新复制一遍。
问题在于,删掉哪些内容由谁决定。
数字、名称和结论通常会被保留下来,因为它们像“重点”。时间范围、例外、数据口径、反方证据和作者的保留态度,则很容易在压缩中消失。可在投资、技术和健康这些需要承担后果的主题里,后面几项往往比结论更重要。
写比特币文章时,如果只保留“当前价格约 8.1 万美元”,却删掉“仍比上一轮高点低三分之一以上”,读者看到的就是一次强势突破,而不是一次深度回撤后的修复。
如果只写“货币供应与价格水平有关”,却省略“货币供应只是政策制定者观察的众多数据之一”,文章就会自然滑向一个过于简单的因果关系。
我现在会反过来问一句:这份总结拿掉了什么?
原文中有哪些“但是、可能、截至、仅限、并不代表”?有没有一段材料与当前结论不完全一致?如果把省掉的内容放回来,读者还会不会作出同样判断?
遗漏不一定是错误。有些内容确实可以不写。判断标准是,它会不会改变读者对风险、因果和适用范围的理解。
语气只重一点,意思就可能变了
AI 很擅长把零散材料整理成完整叙述。为了让文章顺下去,它也容易替原文补上更确定的连接。
“与……有关”变成“导致”,“可能改善”变成“将会改善”,“允许上市交易”变成“得到认可”,“提交给系统”变成“已经送达”。句子确实更有力量,证据却没有一起变强。
OpenAI 2025 年发布的一项研究把这种现象解释得很直接:许多训练和评估方式更奖励猜测,而不是承认不知道。因此,即使能力更强的模型,也仍可能自信地给出错误答案。OpenAI:语言模型为何会产生幻觉
我不准备逐句把文章改成“可能、或许、也许”。那样同样不自然。我的做法是,只盯住会影响判断的词:必然、证明、确认、导致、完全、首次、唯一,以及所有带时间点的“目前”和“已经”。
这些词如果没有足够证据,就降一级。能说“截至某日观察到”,不说“趋势已经确认”;能说“文件允许了什么”,不替文件推断它支持什么。

我现在怎样检查一份 AI 总结
遇到只用于了解大意的材料,我不会把每句话都查一遍。饭店菜单、普通产品说明或者一段不影响行动的背景介绍,过度核对只会把省下来的时间重新花回去。
需要公开发布、涉及资金,或者会影响实际操作时,我会先把总结中的主张拆开。一句话里如果同时有数字、因果和结论,就分成三句检查,避免一个链接替三个判断作证。
随后留下几项简单记录:
| 要检查的内容 | 我需要回答的问题 |
|---|---|
| 原句 | 这句话实际提出了几个主张? |
| 来源位置 | 原文哪一段、哪张表或哪个数据点支持它? |
| 支持范围 | 来源支持的是事实、背景,还是完整结论? |
| 被删掉的内容 | 时间、对象、条件、例外和反方证据有没有消失? |
| 语气变化 | 总结是否比原文更肯定? |
| 最后处理 | 保留、补限制、降低语气,还是删除? |
我也会让 AI 做一次反向审计,但不给它继续润色的任务。提示词可以很短:
只做事实与表达审计,不改写文章。
请逐句列出:
1. 无法由所附来源直接支持的主张;
2. 被省略后会改变读者判断的条件、时间范围或反方证据;
3. 比原始来源更肯定的词句;
4. 需要重新核对日期的数据。
不确定时标记“不确定”,不要补充猜测。
这一步能帮我找到容易漏看的地方,但它仍然不是最终验收。重要链接必须由我自己打开,重要结果也要回到现实里确认。
生成完成,只说明东西已经出来了
iMarketMessage 做真实发送测试时,我遇到过一个很小的错误。
程序已经把消息提交给 Messages,运行状态也没有报错,可手机并没有收到。后来才发现,是我第一次配对时把自己的地址写错了。改正地址,再从后台发送,并在手机上亲眼看到消息,这条链路才算真的完成。
这和检查 AI 总结很像。
生成完成,像程序返回成功;附上链接,像消息已经交给发送系统。它们都说明流程走到了一处,却不说明最后结果已经抵达。
一份总结是否可信,我现在看三个结果:引用能不能回到原文,省略的内容会不会改变判断,语气有没有超过证据。三项都经得住检查,我才会把它放进文章、计划或者下一步行动里。
AI 总结仍然很有用。它替我整理长资料、发现线索,也让我更快看到一件事的大概轮廓。只是从“大概知道”走到“可以据此行动”,中间还需要一次由人完成的验收。