先给结论:当查询参数可以自由组合时,不要试图穷举“所有合法地址”,而要定义一套可判定的白名单规则——哪些参数参与路由、哪些只影响展示、哪些必须被忽略。只有落在白名单组合内的地址才返回 200,其余一律返回 404 或 410。这个集合必须由规则生成并可复核,而不是靠抓取日志事后补漏。
判断依据在于参数是否改变页面主体内容。如果参数会切换商品规格、分页、排序方式,那它属于内容路由的一部分,需要进入有效地址集合;如果参数只用于埋点、会话标识、来源标记,它不改变内容,就不该产生新的可索引地址。
分不清时,先取一组真实参数组合,人工打开对比正文、标题、主要数据是否变化。变化即归入条件一,不变即归入条件二。这个判断动作直接决定下一步是扩展白名单还是收紧忽略列表。
运营、开发、SEO 对“这个地址该不该存在”常有不同理解。把争论转成一张可核对的判定表:每个参数记录名称、是否影响内容、参与路由与否、命中白名单时的状态码。三方按同一张表核对,分歧就落到具体字段上,而不是各说各话。
核对时以实际响应为准:请求该组合,记录返回状态码与正文摘要。如果返回 200 但正文与主地址完全一致,说明它本不该成为独立有效地址。这一步的证据是响应本身,不是任何人的记忆。
假设某筛选页允许颜色、尺码、排序三个参数,每个参数有若干取值。若全部自由组合,地址数量会随参数个数相乘增长。此时先规定:只有“颜色+尺码”参与路由,“排序”只改变展示顺序,不产生新地址。
动作产生的结果是:地址总量从乘法增长变为加法增长,可被枚举和复核。下一步就能对集合外的请求统一处理,而不是逐个补规则。
有些参数虽不影响正文,却影响分页或语言,这类要单独纳入。另一些参数组合虽合法,但内容为空,也应返回 404 而非 200 空页。
还需注意:用 robots.txt 限制抓取不等于可靠的索引移除,被限制的地址仍可能因外部链接出现在结果中,移除要走对应机制。不同搜索引擎对参数处理和规范声明的支持情况须分别核查,不能假设一致。HTTPS 只解决传输加密,不保证地址集合定义正确。
当抓取量或请求量突然归零,不能单独证明处理正确——也可能是抓取预算转移、规则误伤或日志采集中断。要结合响应状态分布和合法组合的命中情况一起判断,再决定是否调整白名单。