第 40 章 网络爬虫

library(tidyverse)
library(rvest)
library(sf)

40.1 链家网

urls <-	paste0("https://sh.lianjia.com/ershoufang/pg", seq_along(1:2))


scrape_house_info  <- function(url) {

	web <- read_html(url)
	
	title <- web %>% 
	  html_nodes('.clear .title a') %>% 
	  html_text()

	houseinfo <- web %>% 
	  html_nodes('.houseInfo') %>%
	  html_text()

	
	price <- web %>% 
	  html_nodes('.totalPrice span') %>% 
	  html_text()

	price_per <- web %>% 
	  html_nodes('.unitPrice span') %>% 
	  html_text()

	df <- data.frame(title, houseinfo, price, price_per) 
	
	return(df)
}
tb <- urls %>% map_df(scrape_house_info)

tb %>% 
  head()
##                                                title
## 1                                   爱嘉苑 2室2厅 南
## 2       川沙2010年商品房,总高13层,双南户型,低总价
## 3   向阳而生、家旺业旺、视野无遮挡带车位,静待有缘人
## 4              全屋定制精装+地铁口+售后公房+满五唯一
## 5 汇金地铁口精装100w,三开间朝南带地下室,南北环境好
## 6       房子新,出行方便,户型正气,采光充足,有车位
##                                                               houseinfo
## 1      2室2厅 | 89.72平米 | 南 | 简装 | 低楼层(共6层) | 2002年建 | 板楼
## 2     2室2厅 | 85.88平米 | 南 | 简装 | 低楼层(共13层) | 2010年建 | 板楼
## 3    3室2厅 | 115.63平米 | 南 | 精装 | 高楼层(共18层) | 2008年建 | 板楼
## 4      3室1厅 | 90.41平米 | 南 | 精装 | 高楼层(共6层) | 1994年建 | 板楼
## 5       5室2厅 | 222平米 | 南 | 精装 | 低楼层(共12层) | 2015年建 | 板楼
## 6 3室2厅 | 147.19平米 | 南 北 | 精装 | 高楼层(共18层) | 2005年建 | 板楼
##   price        price_per
## 1   635 单价70776元/平米
## 2   248 单价28878元/平米
## 3   460 单价39783元/平米
## 4   739 单价81739元/平米
## 5   568 单价25586元/平米
## 6  1380 单价93757元/平米

40.2 猪肉价格

df_price <-
  read_html("https://hangqing.zhuwang.cc/shengzhu/20190905/407978.html") %>%
  html_node(".tabzj") %>%
  html_table(header = T) %>% 
  set_names(
    c("region", "name", "price_today", "price_yestoday", "diff_last_day", "diff_last_week")
    ) %>% 
  mutate_at(vars(name), ~str_remove_all(., " ") ) %>% 
  mutate_at(vars(name), ~if_else( name == "黑龙江", "黑龙江省", .))

df_price %>% 
  head()
##   region   name price_today price_yestoday
## 1   华东 安徽省       28.03          27.79
## 2   华东 山东省       26.62          26.67
## 3   华东 浙江省       29.93          29.83
## 4   华东 江西省       28.93          28.60
## 5   华东 福建省       29.12          28.89
## 6   华东 江苏省       28.05          28.43
##   diff_last_day diff_last_week
## 1          0.24           0.37
## 2         -0.05           0.83
## 3          0.10           1.84
## 4          0.33           0.40
## 5          0.23           0.52
## 6         -0.38           0.88
china <- st_read("./demo_data/chinamap_data/bou2_4p.shp") %>% 
  st_set_crs(4326) %>% 
  group_by(NAME) %>%
  summarize()
## Reading layer `bou2_4p' from data source `G:\R_for_Data_Science\demo_data\chinamap_data\bou2_4p.shp' using driver `ESRI Shapefile'
## Simple feature collection with 925 features and 7 fields
## geometry type:  POLYGON
## dimension:      XY
## bbox:           xmin: 73.45 ymin: 6.319 xmax: 135.1 ymax: 53.56
## CRS:            NA
china_uni <- china %>% 
  mutate( NAME = iconv(NAME, "GBK", "UTF-8") ) %>% 
  mutate_at(vars(NAME), ~str_remove_all(., "自治区|回族|维吾尔|壮族") ) %>%
  mutate_at(vars(NAME), ~str_trim(.))
df <- left_join(china_uni, df_price, by = c("NAME" = "name"))
ggplot(data = df) + 
  geom_sf( aes(fill = price_today < 28), show.legend = FALSE) + 
  geom_sf_text(aes(label = NAME),
               size = 3
               ) +
  geom_sf_text(aes(label = price_today), 
               size = 3,
               #nudge_x = c(-0.4, 0.5, 0.7),
               nudge_y = c(-1, -1, -1)
               ) +
  coord_sf(crs = 4326) +
  ggtitle("全国猪肉价格地图")