防恶意爬虫应保护高成本资源,不能把所有自动访问都拒绝。搜索爬虫与正常客户也会触发频繁请求。
识别行为与成本
查询复杂度、路径遍历、失败比例与会话模式结合判断。
使用渐进限制
先缓存公开内容、限制昂贵端点,再对异常来源验证或短期封禁。
评估副作用
核对搜索抓取与正常访问,提供误拦截恢复。robots规则是访问指引,不能阻止不遵守规则的攻击。
恶意爬取按业务成本治理
区分公开读取、高频搜索与昂贵导出,限流和缓存减轻压力,记录规则影响。
合法搜索抓取避免误拦截,必要时核实来源,不仅依赖用户代理字符串识别身份。
例如正常搜索抓取被误拦截,核对来源和请求模式后调整,用户代理名称不能作为唯一依据。
相关阅读:网站DDoS与异常流量:CDN、容量和防护选择。