1
ljcarsenal Aug 25, 2016
你在页面上 ctrl+u 看到的是什么样的内容 爬虫爬到的就是什么样的内容
|
2
eromoe Aug 25, 2016
纯 js 网站就是这样啊,我记得好像可以用 pyv8 运行 js ,但是文档很不完善,基本就是坑
|
3
liangmishi OP |
4
chairuosen Aug 25, 2016
用 vue2.0 的 server-side renderer
|
5
foomorrow Aug 25, 2016
phantomjs
|
6
eromoe Aug 25, 2016
@foomorrow
纯 python 就是 selenium +webdriver(phantomjs), 要不还要学 phantomjs (虽然也不难,不过也有些坑) |
7
isbase PRO 推荐 nightmare
|
8
iamsgg Aug 25, 2016
有的网站看来路,来路不对不返回内容。
|
9
liangmishi OP |
10
holajamc Aug 25, 2016
可以试试 httplib2 ,我觉得这玩意儿就是 Python 下的 HTTP 请求的王者, Selenium+PhantomJS 的话效率惨不忍睹,但是十分方便,多线程呗~
|
11
tumb8r Aug 25, 2016
ajax??不返回 json ?
|
12
ericls Aug 25, 2016 via iPhone
直接爬接口不是更方便 直接 parse json
|
13
pncltp Aug 26, 2016 via iPhone
爬虫请用 scrapy 今天都说第二遍了。
|
14
WildCat Aug 26, 2016
@liangmishi nightmare 完爆 phantomjs
|
17
killerv Aug 26, 2016
这种调接口的更好爬吧,你要是解析页面当然是没有数据……
|
18
liangmishi OP |
19
holajamc Aug 26, 2016 via Android
不会太占内存,毕竟 Headless , 10 个线程绝对能够应付
|
20
ericls Aug 26, 2016
@liangmishi 如果没有接口那数据哪里来的
|
21
liangmishi OP |
22
ericls Aug 26, 2016
@liangmishi 你也可以翻译这段代码
|