go爬虫フレーム-colly実戦(二)--豆弁top 250爬取
1858 ワード
原文接続:Hzyブログ
直接コードをつけました.コメントがあります.
colly-top250.png
1.今日はcollyで豆弁Top 250を登ってみました!(みんなは彼を手に入れるのが好きだ.)
直接コードをつけました.コメントがあります.
package main
import (
"fmt"
"github.com/PuerkitoBio/goquery"
"github.com/gocolly/colly"
"github.com/gocolly/colly/extensions"
"regexp"
"strings"
"time"
)
func main() {
t := time.Now()
number := 1
c := colly.NewCollector(func(c *colly.Collector) {
extensions.RandomUserAgent(c) //
c.Async=true
},
// url, https://movie.douban.com/top250?start=0&filter= url
colly.URLFilters(
regexp.MustCompile("^(https://movie\\.douban\\.com/top250)\\?start=[0-9].*&filter="),
),
) //
// HTML,
c.OnHTML("a[href]", func(e *colly.HTMLElement) {
link := e.Attr("href")
//fmt.Printf("find link: %s
", e.Request.AbsoluteURL(link))
c.Visit(e.Request.AbsoluteURL(link))
})
//
c.OnHTML("div.info", func(e *colly.HTMLElement) {
e.DOM.Each(func(i int, selection *goquery.Selection) {
movies := selection.Find("span.title").First().Text()
director := strings.Join(strings.Fields(selection.Find("div.bd p").First().Text()), " ")
quote := selection.Find("p.quote span.inq").Text()
fmt.Printf("%d --> %s:%s %s
", number, movies, director, quote)
number += 1
})
})
c.OnError(func(response *colly.Response, err error) {
fmt.Println(err)
})
c.Visit("https://movie.douban.com/top250?start=0&filter=")
c.Wait()
fmt.Printf(" :%s",time.Since(t))
}
colly-top250.png