Alexa TOP 100万的域名列表

Alexa是一家专门发布网站世界排名的网站,是亚马逊公司的一家子公司。Alexa每天在网上搜集多达几十亿的网址链接,而且为其中的每一个网站进行了排名。

Alexa通过Alexa官网查询好像TOP 500以后是需要付费的,网上也没有较完整列表,所以分享下。
数据爬取来源:http://stuffgate.com/stuff/website/
贴一小段:

google.com
youtube.com
facebook.com
baidu.com
yahoo.com
amazon.com
wikipedia.org
qq.com
google.co.in
twitter.com
live.com
taobao.com
msn.com
sina.com.cn
yahoo.co.jp
google.co.jp
linkedin.com
weibo.com
bing.com
yandex.ru
vk.com
hao123.com
instagram.com
ebay.com
google.de
amazon.co.jp
mail.ru
tmall.com
360.cn
google.co.uk
pinterest.com
google.ru
reddit.com
google.com.br
t.co
netflix.com
google.fr
sohu.com
paypal.com
microsoft.com
wordpress.com
google.it
google.es
blogspot.com
gmw.cn
onclickads.net
tumblr.com
ok.ru
imgur.com
aliexpress.com
xvideos.com
stackoverflow.com
apple.com
google.com.mx
imdb.com
fc2.com
google.com.hk
ask.com
amazon.de
google.com.tr
google.ca
alibaba.com
office.com
rakuten.co.jp
tianya.cn
pornhub.com
google.co.id
diply.com
github.com
craigslist.org
soso.com
go.com
xinhuanet.com
nicovideo.jp
amazon.co.uk
pixnet.net
bongacams.com
blogger.com
amazon.in
outbrain.com
cnn.com
googleusercontent.com
cntv.cn
kat.cr
jd.com
google.pl
google.com.au
naver.com
dropbox.com
coccoc.com
xhamster.com
360.com
adobe.com
china.com
haosou.com
microsoftonline.com
whatsapp.com
nytimes.com
adnetworkperformance.com
flipkart.com

完整的数据请见:
top-1000000-domains

有什么用呢?
我觉得可以用于一些字典采集工作,比如需要一个目录扫描的字典,可以爬取所有网站列表robots.txt文件,或对网站目录进行浅爬行,将爬行结果进行词频分析统计;
也可以对排名靠后的一些网站进行网站指纹、IP、WEB服务器版本等信息进行识别,将识别结果入库,对于研究一些特定数据会有帮助。

 

来源:http://www.rootat.net/2016/03/21/AlexaTop1000000/

posted @ 2016-04-20 14:19  k2ng  阅读(1790)  评论(0编辑  收藏  举报