拆分长文时,判断一页是否合格的标准不是“它分到了多少字”,而是它能否在读者不点回原文、不依赖上一页的前提下,把一个小问题讲完整。个别长文拆分后表现正常,往往是因为原页面本身已积累了足够的外部链接与访问行为;规模化拆分时这些条件不再成立,各页就必须靠自身内容独立承接需求,否则容易出现多页互相竞争、每页都答不完整的情况。
要独立的是“问题—答案”的闭环,不是主题词。一篇讲“外链建设”的长文,如果拆成“什么是外链”“外链类型”“外链获取渠道”三页,读者搜“外链获取渠道”时,第三页若只罗列渠道名称而不说适用条件、操作顺序和失败信号,它就没有独立回答问题,只是原文的一个切片。
判断方法很直接:给每页写一句“这页回答的问题是……”,然后问自己,读者读完这句问题对应的内容后,是否还需要回到其他页才能动手。需要,就说明拆分边界切错了,应该把相关段落并回去,或者把答案补全。
拆分时对每个候选页面,实际只有三种动作,前提不同,不能一律保留。
一个假设例子:某页讲“结构化数据标注流程”,拆出“如何选择 schema 类型”和“如何验证标注结果”。前者有独立问题,可保留;后者若只写“用工具验证”,缺少验证前应准备什么、报错如何归类,就属于需要改写;而“标注前的文件命名建议”通常无法独立成题,应退出。
拆分后某页流量没有起色,不能直接归因于拆分动作本身。至少存在几种合理解释:原页面承接的查询被分散到多页,单页获得的点击自然下降;新页尚未被充分抓取和评估;搜索需求本身在改动前后发生了季节性或事件性变化。把其中任何一种直接当成“拆分失败”的证据都不成立。
要区分原因,可以做一个受控比较:保留一小组未拆分的同类页面作为参照,记录改动前后同一时间窗内的展示与点击变化,同时留意需求侧是否有明显波动。如果参照组同步下降,问题更可能出在需求或采集口径;如果只有拆分页下降,再检查各页是否在回答同一问题、标题是否互相覆盖。这一步的结论会直接决定下一步:是合并回退,还是补全某页的答案,而不是继续拆更多页。
个别样本成立,常常因为样本量小、原页权重集中、竞争不激烈。规模化后例外会集中出现:同一主题下多页标题相近,读者在结果页看到的都是半截答案,点击分散,任何一页都难以形成稳定的问题—答案对应。
因此拆分前应设一条退出线,例如:若某页在合理观察窗口内持续只获得零散展示、且无法通过补全答案改善,就把它合并回最相关的一页,而不是继续为它寻找新标题。这条线的意义是控制页面总数,避免用数量代替回答质量。每次合并或补全后,重新检查剩余页面是否各自回答了不同问题,再决定是否继续拆分下一段。
实际操作可以从一篇长文里挑出三到五个候选段落,先写它们各自要回答的问题,再按保留、改写、退出分类。对判定为改写的段落,补上读者动手前需要的前提和做完后的判断依据;对判定为退出的段落,直接并入相邻页并删除独立标题。改完后对照参照页面观察一段时间,重点看各页是否还在争同一批查询,而不是只看总流量。若发现两页仍在回答同一问题,优先合并,再考虑是否值得为剩下的问题单独成页。