利用selenium爬虫抓取数据的基础教程_Python

写在前面

本来这篇文章该几个月前写的，后来忙着忙着就给忘记了。

ps:事多有时候反倒会耽误事。

几个月前，记得群里一朋友说想用selenium去爬数据，关于爬数据，一般是模拟访问某些固定网站，将自己关注的信息进行爬取，然后再将爬出的数据进行处理。

他的需求是将文章直接导入到富文本编辑器去发布，其实这也是爬虫中的一种。

其实这也并不难，就是ui自动化的过程，下面让我们开始吧。

准备工具/原料

1、java语言

2、idea开发工具

3、jdk1.8

4、selenium-server-standalone（3.0以上版本）

步骤

1、分解需求：

需求重点主要是要保证原文格式样式都保留：

将要爬取文章,全选并复制

将复制后的文本，粘贴到富文本编辑器中即可

2、代码实现思路：

键盘事件模拟ctrl+a全选

键盘事件模拟ctrl+c复制

键盘事件模拟ctrl+v粘贴

3、实例代码

				?

									import org.junit.afterclass;

									import org.junit.beforeclass;

									import org.junit.test;

									import org.openqa.selenium.by;

									import org.openqa.selenium.webdriver;

									import org.openqa.selenium.chrome.chromedriver;

									import java.awt.*;

									import java.awt.event.keyevent;

									import java.util.concurrent.timeunit;

									/**

									 * @author rongrong

									 * selenium模拟访问网站爬虫操作代码示例

									 */

									public class demo {

									 private static webdriver driver;

									 static final int max_timeout_in_seconds = 5;

									 @beforeclass

									 public static void setupbeforeclass() throws exception {

									  driver = new chromedriver();

									  string url = "https://temai.snssdk.com/article/feed/index?id=6675245569071383053&subscribe=5501679303&source_type=28&content_type=1&create_user_id=34013&adid=__aid__&tt_group_id=6675245569071383053";

									  driver.manage().window().maximize();

									  driver.manage().timeouts().implicitlywait(max_timeout_in_seconds, timeunit.seconds);

									  driver.get(url);

									 }

									 @afterclass

									 public static void teardownafterclass() throws exception {

									  if (driver != null) {

									   system.out.println("运行结束！");

									   driver.quit();

									  }

									 }

									 @test

									 public void test() throws interruptedexception {

									  robot robot = null;

									  try {

									   robot = new robot();

									  } catch (awtexception e1) {

									   e1.printstacktrace();

									  }

									  robot.keypress(keyevent.vk_control);

									  robot.keypress(keyevent.vk_a);

									  robot.keyrelease(keyevent.vk_a);

									  thread.sleep(2000);

									  robot.keypress(keyevent.vk_c);

									  robot.keyrelease(keyevent.vk_c);

									  robot.keyrelease(keyevent.vk_control);

									  driver.get("https://ueditor.baidu.com/website/onlinedemo.html");

									  thread.sleep(2000);

									  driver.switchto().frame(0);

									  driver.findelement(by.tagname("body")).click();

									  robot.keypress(keyevent.vk_control);

									  robot.keypress(keyevent.vk_v);

									  robot.keyrelease(keyevent.vk_v);

									  robot.keyrelease(keyevent.vk_control);

									  thread.sleep(2000);

									 }

									}