11 2015 档案

摘要:今天由于某种原因需要将pdf中的文本提取出来,就去搜了下资料,发现PDFMiner是针对 内容提取的,虽然最后发现pdf里面的文本全都是图片,就没整成功,不过试了个文本可复制的 那种pdf文件,发现还是蛮好用的。 PDFMiner python的PDF解析器和分析器 1.官方文档:http://ww 阅读全文
posted @ 2015-11-19 22:14 简易人生 阅读(23261) 评论(6) 推荐(6)
摘要:先使用以前的方法将返利网的数据爬取下来,scrapy框架还不熟练,明日再战scrapy 查找目标数据使用的是beautifulsoup模块。 1.观察网页,寻找规律 打开值得买这块内容 1>分析数据来源 网页上的数据分为一打开页面就存在的数据(源代码中可以看到的数据), 还有随着鼠标滑动,动态加载的 阅读全文
posted @ 2015-11-05 22:13 简易人生 阅读(2137) 评论(6) 推荐(0)