Java+Selenium3方法篇18-获取当前页的源码【转载】

本篇介绍webdriver中获取当前页面的源码,driver.getPageSource()的功能就类似,你打开一个网页,然后右键,选择查看源码一样效果。这个获取网页的源码,在网络爬虫中百分百是需要用到的。先来了解下,我们通过获取百度新闻首页的源码,打印到eclipse,看看效果。

相关脚本代码如下:

[java] view plain copy
  1. package lessons;  
  2.   
  3. import java.util.concurrent.TimeUnit;  
  4.   
  5. import org.openqa.selenium.By;  
  6. import org.openqa.selenium.WebDriver;  
  7. import org.openqa.selenium.WebElement;  
  8. import org.openqa.selenium.chrome.ChromeDriver;  
  9.   
  10. public class ElementOpration {  
  11.     public static void main(String[] args) throws Exception {    
  12.           
  13.         System.setProperty("webdriver.chrome.driver", ".\\Tools\\chromedriver.exe");    
  14.              
  15.         WebDriver driver = new ChromeDriver();    
  16.        
  17.         driver.manage().window().maximize();    
  18.          
  19.         driver.manage().timeouts().implicitlyWait(5, TimeUnit.SECONDS);  
  20.             
  21.         driver.get("https://www.baidu.com");    
  22.          
  23.         Thread.sleep(1000);  
  24.          
  25.         WebElement news_link = driver.findElement(By.linkText("新闻"));  
  26.         news_link.click();  
  27.         Thread.sleep(1000);  
  28.          
  29.         // 打印当前页面的源码  
  30.         System.out.println(driver.getPageSource());  
  31.                   
  32.     }    
  33. }  

       获取当前页源码就介绍到这里,至于如何拿到源码,如何去查找我们需要的信息,这里就不介绍。因为需要一点前端知识,和正则匹配的内容。

posted on 2018-04-28 13:20  okeymen  阅读(120)  评论(0)    收藏  举报

导航