各类分析报告堆在这里,出自不同的库。规矩是同一套: 每条事实可追溯到来源与年份,判断与事实分开存, 说不出来的地方登记成缺口而不是含糊过去,被推翻的结论留痕不删。
报告出自不同的库。两组数字不能并排相加 —— 口径不同,节点、事实、来源在两边的定义都不一样。所以分开列。
130 是当期的物质流事实(成分边 + 转化边 + 几何参数, 不含已废止的行)。把碳强度、市场统计、产能、HS 映射这些都算进来, 带来源的事实共 204 条 —— 两个数都对,差别在口径,所以标签得写清是哪一个。
51 个登记来源里,只有 29 个真的被事实引用。另外 22 个是登记了、 还没抽出可用数值的 —— 摆在这里是为了别让「来源很多」这件事看起来比实际更充实。
缺口是结构的一部分,不是待办清单。那 6 条阻断性缺口里, 一条是设计边界(意图、概率、时点 —— 没有公开数据能支撑),三条要付费, 两条是人工录入的活。把它们摊开列出来,是为了让读的人知道结论到哪里为止。
这个库把判断和事实分开存,并保留判断被修正的历史。 所以报告里会出现「我原来写错了」这类段落 —— 那是刻意保留的,不是没清理干净。 引用时看状态:已推翻的不能用作论据,已修正的必须说明。
66 个来源里只有 22 个带公开 URL。其余是本地存档或研究材料, 页面上如实标注「无公开 URL」,不假装有。
覆盖度低不等于风险低。证据缺失一律按「未通过」计, 所以证据不全的项会天然排在后面 —— 那是「我们不知道」,不是「它不危险」。 看排序之前先看覆盖度。
结构暴露,不是行为预测。不给概率、不给意图、不给时点 —— 这三件事没有任何公开数据能支撑,硬给一个数就是编。需要概率的场景, 应该由下游模型消费这里的结构量。
口径决定可比性。同一个量换个口径能差好几倍: 矿山 vs 精炼、金额 vs 数量、铭牌 vs 有效产能;换到企业侧就是 授标公告值 vs 合同上限 vs 实际支付。凡是并排比较的数,都会说明为什么它们敢并排。
三种「没有」要分清。已核查为否(查过,确认不存在,是结论,可直接引用)、 未覆盖(材料只抽了一部分,是不知道)、语料边界外(根本没有,需外部补采)—— 混为一谈是最容易误导人的错误。