爬虫实战
# 爬虫实战
页面采集应先确认站点条款、robots 规则和数据授权。客户端需要清晰的 User-Agent、超时、并发限制、重试上限与缓存策略。
request, err := http.NewRequestWithContext(ctx, http.MethodGet, target, nil)
if err != nil {
return err
}
request.Header.Set("User-Agent", "MeiChenResearchBot/1.0")
response, err := client.Do(request)
if err != nil {
return err
}
defer response.Body.Close()
1
2
3
4
5
6
7
8
9
10
2
3
4
5
6
7
8
9
10
检查状态码和 Content-Type 后再解析正文。HTML 应使用解析器构建节点树,不用单个正则表达式处理文档;不要绕过登录、验证码、付费墙或访问控制。