减少冗余的关键不是把重复事实删干净,而是先判断它在每篇文章里承担什么任务:如果它负责支撑不同结论,就保留并改写;如果只是背景填充,就压缩或退出。先做一次逐篇标注,再决定保留、改写或退出,能避免误删后又要补回。
同一事实出现在多篇文章中,通常有两种角色。第一种是论据:它直接支撑某篇文章的结论,例如一篇讲成本结构,另一篇讲交付周期,同一组参数在两处分别证明不同判断。第二种是背景:它只是让文章显得完整,删掉后论证仍然成立。判断方法很简单——在每篇文章里把该事实所在段落遮住,看结论是否还站得住。站不住,说明它是论据;站得住,说明它更接近背景。
这个区分决定了后续动作。论据型重复不能简单删除,否则文章会失去支撑;背景型重复才是压缩和退出的主要对象。
保留适用于事实在两篇文章中服务于不同问题,且读者不会连续阅读这两篇。此时重复是必要的,但应避免逐字相同。可以保留数据本身,换掉解释角度:一篇强调它对成本的影响,另一篇强调它对排期的影响。前提是两篇文章的入口和阅读路径确实不同,而不是同一批读者按顺序读完。
改写适用于事实相同但表述已经机械换词。把“提升了效率”改成“提高了效率”不产生新价值,真正有效的改写是改变它在段落中的功能:从定义变成对比,从结论变成前提。例如同一组假设数字,一篇用来比较两种方案,另一篇用来指出某个条件不成立。改写的前提是你能说清改后它在论证中多了什么作用。
退出适用于该事实在某一篇中既不是论据,也不影响读者下一步动作。退出不等于删除所有痕迹,可以只留一句指向更完整那篇的说明,让需要细节的读者有路径。前提是站内确实存在那篇更完整的文章,并且链接关系清晰;如果没有,退出会让信息断掉,此时应改为压缩保留。
假设你有两篇文章都写到某类设备的额定功率。A 篇讨论选型,B 篇讨论运维成本。第一步,遮住功率段落:A 篇的选型结论依赖它,B 篇的运维结论也依赖它,两处都是论据。第二步,看读者路径:选型读者和运维读者大概率不是同一批人,连续阅读概率低。第三步,决定保留,但改写功能——A 篇把它写成筛选门槛,B 篇把它写成成本计算的输入项。动作结果是:两篇文章各自成立,读者不会因为读到相同数字而觉得在重复阅读。如果第三步改成直接删除 B 篇的数字,B 篇的成本结论就失去依据,下一步就得补回,反而增加工作量。
可以按下面顺序操作,每步都产生可检查的结果:
完成盘点后,你会得到一份保留、改写、退出的清单。下一步不是立刻批量修改,而是先改其中一篇,观察修改后该篇的论证是否仍然完整、读者下一步动作是否仍然明确。如果一篇改完出现结论悬空,说明前面把论据误判成了背景,需要回退到保留或改写。这个回退动作本身就是判断是否准确的证据,比事后凭感觉评估更可靠。
第一种是把“文字不同”当成“内容不同”。同义词替换后的段落仍然承担同一功能,对读者没有新增信息,这类改写不解决冗余。第二种是把“出现过”当成“必须删”。同一事实在不同结论中反复出现,是论证需要,不是冗余。真正要减少的是既不支撑结论、也不影响下一步动作的填充内容。
另外,重复事实减少后,某些页面的抓取量或展示量出现波动,不能单独证明处理正确。波动还可能来自发布时间、入口调整、季节变化或统计口径变化。判断处理是否有效,应回到文章本身:结论是否仍然成立,读者是否能找到下一步该做的事。这两点成立,冗余处理才算完成。