这是一个黑科技:C++爬虫~(文末报名C/C++领域新星计划)

news2024/11/15 13:44:36

目录

写在前面

 

完整代码

这里必看!!

写在最后


写在前面

现在所有人都知道万能的Python可以做机器学习,可以做人工智能,可以爬取各种小网站,但是你不知道,基于C++的正则表达式早就能够爬取各种网络数据啦!!你没猜错,阿玥将在这篇文章中简介怎么用C++基于Regex的库写一个爬虫~

 

正则表达式Regex(regular expression)是一种强大的描述字符序列的工具。在许多语言中都存在着正则表达式,C++11中也将正则表达式纳入了新标准的一部分,不仅如此,它还支持了6种不同的正则表达式的语法,分别是:ECMASCRIPT、basic、extended、awk、grep和egrep。其中ECMASCRIPT是默认的语法,具体使用哪种语法我们可以在构造正则表达式的时候指定。

注:ECMAScript是一种由Ecma国际(前身为欧洲计算机制造商协会,英文名称是European Computer Manufacturers Association)通过ECMA-262标准化的脚本程序设计语言。它往往被称为JavaScript,但实际上后者是ECMA-262标准的实现和扩展。

1. 确保你的编译器支持Regex

如果你的编译器是GCC-4.9.0或者VS2013以下版本,请升级后,再使用。我之前使用的C++编译器,是GCC 4.8.3,有regex头文件,但是GCC很不厚道的没有实现,语法完全支持,但是库还没跟上,所以编译的时候是没有问题的,但是一运行就会直接抛出异常,非常完美的一个坑有木有!具体错误如下:

1

2

3

terminate called after throwing an instance of 'std::regex_error'

what(): regex_error

Aborted (core dumped)

如果你也遇到了这个问题,请不要先怀疑自己,GCC这一点是非常坑爹的!!!我在这个上面浪费了半天的时间才找了出来。所以在尝鲜C++的正则表达式之前,请升级你的编译器,确保你的编译器支持它。

2. regex库概览

在头文件<regex>中包含了多个我们使用正则表达式时需要用到的组件,大致有:

1

2

3

4

5

6

7

8

9

10

11

12

13

14

basic_regex

//正则表达式对象,是一个通用的模板,有typedef basic_regex<char> regex 和 typedef basic_regex<char_t>wregex;

regex_match

//将一个字符序列和正则表达式匹配;

regex_search

//寻找字符序列中的子串中与正则表达式匹配的结果,在找到第一个匹配的结果后就会停止查找;

regex_replace

//使用格式化的替换文本,替换正则表达式匹配到字符序列的地方;

regex_iterator

//迭代器,用来匹配所有的子串;

match_results

//容器类,保存正则表达式匹配的结果;

sub_match

//容器类,保存子正则表达式匹配的字符序列。

1. ECMASCRIPT正则表达式语法

正则表达式式的语法基本大同小异,在这里就浪费篇幅细抠了。ECMASCRIPT正则表达式的语法知识可以参考W3CSCHOOL。

2. 构造正则表达式

构造正则表达式用到一个类:basic_regex。basic_regex是一个正则表达式的通用类模板,对char和wchar_t类型都有对应的特化:

1

2

typedef basic_regex<char>    regex;

typedef basic_regex<wchar_t> wregex;

构造函数比较多,但是非常简单:

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

//默认构造函数,将匹配任何的字符序列

basic_regex();

//用一个以‘\0’结束的字符串s构造一个正则表达式

explicit basic_regex( const CharT* s,flag_type f =std::regex_constants::ECMAScript );

//同上,但是制定了用于构造的字符串s的长度为count

basic_regex( const CharT* s, std::size_t count,flag_type f = std::regex_constants::ECMAScript );

//拷贝构造,不赘述

basic_regex( const basic_regex& other );

//移动构造函数

basic_regex( basic_regex&& other );

//以basic_string类型的str构造正则表达式

templateclass ST, class SA >explicit basic_regex( const std::basic_string<CharT,ST,SA>& str, flag_type f = std::regex_constants::ECMAScript );

//指定范围[first,last)内的字符串构造正则表达式

templateclass ForwardIt >basic_regex( ForwardIt first, ForwardIt last, flag_type f = std::regex_constants::ECMAScript );

//使用initializer_list构造

basic_regex( std::initializer_list<CharT> init, flag_type f = std::regex_constants::ECMAScript );

以上除默认构造之外的构造函数,都有一个flag_type类型的参数用于指定正则表达式的语法,ECMASCRIPT、basic、extended、awk、grep和egrep均是可选的值。除此之外还有其他几种可能的的标志,用于改变正则表达式匹配时的规则和行为:

1

2

3

4

5

6

7

8

flag_type

//effect

sicase

//在匹配过程中忽略大小写

nosubs

//不保存匹配的子表达式

optimize

//执行速度优于构造速度

有了构造函数之后,现在我们就可以先构造出一个提取http链接的正则表达式:

1

2

std::string pattern("http(s)?://([\\w-]+\\.)+[\\w-]+(/[\\w- ./?%&=]*)?");    //匹配规则很简单,如果有疑惑,可以对照语法查看

std::regex r(pattern);

值得一提的是在C++中’\’这个字符需要转义,因此所有ECMASCRIPT正则表达式语法中的’\’都需要写成“\”的形式。我测试的时候,这段regex如果没有加转义,在gcc中会给出警告提示,vs2013编译后后运行直接崩溃了。

3. 正确地处理输入

先扯一个题外话,假设我们不是使用了网络库自动在程序中下载的网页,在我们手动下载了网页并保存到文件后,首先我们要做的还是先把网页的内容(html源码)存入一个std::string中,我们可能会使用这样的错误方式:

1

2

3

4

5

6

int main()

{    

    std::string tmp,html;    

    while(std::cin >> tmp)

        html += tmp;

}

这样一来源代码中所有的空白字符就无意中被我们全处理了,这显然不合适。这里我们还是使用getline()这个函数来处理:

1

2

3

4

5

6

7

8

9

int main()

{    

    std::string tmp,html;    

    while(getline(std::cin,tmp))

        {

            html += tmp;

            html += '\n';

        }

}

这样一来原来的文本才能得到正确的输入。当然个人以为这些小细节还是值得注意的,到时候出错debug的时候,我想我们更多地怀疑的是自己的正则表达式是否是有效。

4. regex_search() 只查找到第一个匹配的子序列

根据函数的字面语义,我们可能会错误的选择regex_search()这个函数来进行匹配。其函数原型也有6个重载的版本,用法也是大同小异,函数返回值是bool值,成功返回true,失败返回false。鉴于篇幅,我们只看我们下面要使用的这个:

1

2

3

templateclass STraits, class SAlloc,class Alloc, class CharT, class Traits >

bool regex_search( const std::basic_string<CharT,STraits,SAlloc>& s,                              std::match_results<typename std::basic_string<CharT,STraits,SAlloc>::const_iterator, Alloc>& m,

                   const std::basic_regex<CharT, Traits>& e,                                      std::regex_constants::match_flag_type flags = std::regex_constants::match_default );

第一个参数s是std::basic_string类型的,它是我们待匹配的字符序列,参数m是一个match_results的容器用于存放匹配到的结果,参数e则是用来存放我们之前构造的正则表达式对象。flags参数值得一提,它的类型是std::regex_constants::match_flag_type,语义上匹配标志的意思。正如在构造正则表达式对象时我们可以指定选项如何处理正则表达式一样,在匹配的过程中我们依然可以指定另外的标志来控制匹配的规则。这些标志的具体含义,可以参考下表,用的时候查一下就可以了:

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

match_not_bol

//The first character in [first,last) will be treated as if it is not at the beginning of a line (i.e. ^ will not match [first,first)

match_not_eol

//The last character in [first,last) will be treated as if it is not at the end of a line (i.e. $ will not match[last,last)

match_not_bow

// "\b" will not match [first,first)

match_not_eow

// "\b" will not match [last,last)

match_any

//If more than one match is possible, then any match is an acceptable resultmatch_not_null

//Do not match empty sequences

match_continuous

//Only match a sub-sequence that begins at firstmatch_prev_avail

//--first is a valid iterator position. When set, causes match_not_bol and match_not_bow to be ignoredformat_default

//Use ECMAScript rules to construct strings in std::regex_replace (syntax documentation)

format_sed

//Use POSIX sed utility rules in std::regex_replace. (syntax documentation)

format_no_copy

//Do not copy un-matched strings to the output in std::regex_replace

根据参数类型,于是我们构造了这样的调用:

1

2

std::smatch results;

<br>regex_search(html,results,r);

不过,标准库规定regex_search()在查找到第一个匹配的子串后,就会停止查找!在本程序中,results参数只带回了第一个满足条件的http链接。这显然并不能满足我们要提取网页中所有HTTP链接需要。

5. 使用 regex_iterator 匹配所有子串

严格意义上regex_iterator是一种迭代器适配器,它用来绑定要匹配的字符序列和regex对象。regex_iterator的默认构造函数比较特殊,就直接构造了一个尾后迭代器。另外一个构造函数原型:

1

2

3

regex_iterator(BidirIt a, BidirIt b,   //分别是待匹配字符序列的首迭代器和尾后迭代器

               const regex_type& re,   //regex对象

               std::regex_constants::match_flag_type m = std::regex_constants::match_default);                        //标志,同上面的regex_search()中的

和上边的regex_search()一样,regex_iterator的构造函数中也有std::regex_constants::match_flag_type类型的参数,用法一样。其实regex_iterator的内部实现就是调用了regex_search(),这个参数是用来传递给regex_search()的。用gif或许可以演示的比较形象一点,具体是这样工作的(颜色加深部分,表示可以匹配的子序列):

首先在构造regex_iterator的时候,构造函数中首先就调用一次regex_search()将迭代器it指向了第一个匹配的子序列。以后的每一次迭代的过程中(++it),都会在以后剩下的子序列中继续调用regex_search(),直到迭代器走到最后。it就一直“指向”了匹配的子序列。

完整代码

知道了原理,我们写起来代码就轻松多了。结合前面的部分我们,这个程序就基本写好了:

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

#include <iostream>

#include <regex>

#include <string>

int main()

{

    std::string tmp,html;    

    while(getline(std::cin,tmp))

        {

            tmp += '\n';

            html += tmp;

        }    

        std::string pattern("http(s)?://([\\w-]+\\.)+[\\w-]+(/[\\w- ./?%&=]*)?");

        pattern = "[[:alpha:]]*" + pattern + "[[:alpha:]]*";    

        std::regex r(pattern);

        for (std::sregex_iterator it(html.begin(), html.end(), r), end;it != end;++it)        //end是尾后迭代器,regex_iterator是regex_iterator的string类型的版本

        {        

            std::cout << it->str() << std::endl;

        }

}

到这里各位小伙伴们就已经可以去找自己喜欢的各种网站去爬爬爬了!!!

3. regex 和异常处理

如果我们的正则表达式存在错误,则在运行的时候标准库会抛出一个regex_error异常,他有一个名为code的成员,用于标记错误的类型,具体错误值和语义如下表所示:

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

18

19

20

21

22

23

24

25

26

error_collate

//无效的元素校对;

error_ctype

//无效的字符类;

error_escape

//无效的转移字符或者无效的尾置转义;

error_backref

//无效的向后引用;

error_brack

//方括号不匹配;

error_paren

//小括号不匹配;

error_brace

//大括号不匹配;

error_badbrace

//大括号中的范围无效;

error_range

//无效的(不合法)字符范围;

error_space

//内存不足;

error_badrepeat

//重复字符之前没有正则表达式(* + ?);

error_complexity

//太复杂了,标准库君hold不住了;

error_stack

//栈空间不足了。

这里必看!!

新星计划2023【C/C++领域基础】学习方向报名入口:

点击这里即可!!

大家参加本次计划就可以获得100积分哦!

可以学习C/c++的许多知识,大家要踊跃参加哦!!!

写在最后

希望大家可以踊跃报名以上新星计划哦,不但可以学习好多知识,还有许多海量奖品等你来拿!!!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/464807.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

华为OD机试——对称美学(通过率只有8.51%???)

用java写的这道题&#xff0c;两个样例都可以通过&#xff0c;但是提交之后最终的通过率只有8.51%&#xff1f;&#xff1f;&#xff1f;自己搞了半天一直都是这个通过率&#xff0c;然后用网上说的100%通过率的代码也是一样的结果&#xff0c;最后时间到了还是没有拿到满分&am…

这些vue基本语法,你掌握了吗

文章目录 一、 vue 项目重点概念介绍1. 单页面应用程序2. 单文件组件3.数据驱动视图 二、 vue 基本结构1、template2、script3、style 三、 vue 常用指令介绍1、内容渲染指令&#xff08;1&#xff09;插值表达式 {{xxx}} —常用方式&#xff08;2&#xff09;v-text&#xff0…

session和JWT的应用及区别

文章目录 登录认证(node)一、session1.下载session2.全部配置session3.存储session4.获取session5.销毁session 二、JWT (Json web token)1.JWT 的工作原理2.JWT 的组成3.下载JWT4.生成token5.解密TOken6.配置全局错误中间件 登录认证(node) 一、session 一、在node中使用sess…

还不懂Redis?看完这个故事就明白了!

还不懂Redis?看完这个故事就明白了! 我是Redis 你好,我是Redis,一个叫Antirez的男人把我带到了这个世界上。 说起我的诞生,跟关系数据库MySQL还挺有渊源的。 在我还没来到这个世界上的时候,MySQL过的很辛苦,互联网发展的越来越快,它容纳的数据也越来越多,用户请求也…

全国独家专利药品有哪些品种?全国独家药品产品汇总查阅

独家药品一般是指某一家药企拥有生产和销售某种药品的独家权利&#xff0c;细分有活性成分独家&#xff08;通用名成分独家&#xff09;、品种独家&#xff08;同成分不同剂型&#xff09;、独家品规&#xff0c;通俗可以分成药品功能独家和产品独家。独家药品经常被人认为是具…

证件拍照扫描——基于C++与深度神经网络实现证件识别扫描并1比1还原证件到A4纸上

前言 数字化时代的到来&#xff0c;越来越多的证件需要进行电子化处理&#xff0c;例如身份证、驾驶证、护照等。在进行电子化处理时&#xff0c;最常见的需求就是将证件照片复制到A4纸上&#xff0c;以便于打印、存档或传输。同时&#xff0c;为了方便信息的录入和管理&#…

一条命令搭建HTTP服务器

文章目录 1.前言2.本地http服务器搭建2.1.Python的安装和设置2.2.Python服务器设置和测试 3.cpolar的安装和注册3.1 Cpolar云端设置3.2 Cpolar本地设置 4.公网访问测试5.结语 转载自远程内网穿透的文章&#xff1a;【Python】快速简单搭建HTTP服务器并公网访问「cpolar内网穿透…

word自带公式编辑

快捷键&#xff1a; 公式编辑&#xff1a;alt“” 上标&#xff1a;x^i 空格 下标&#xff1a;x_i 空格 实数R&#xff1a;\doubleR 空格 偏微分算子&#xff1a;“\partial” 极限&#xff1a;“\limit”&#xff08;按空格后会显示一串很长的式子&#xff0c;再空格就变…

在Linux操作系统上部署wgcloud监控

1.wgcloud监控介绍 1.1 介绍 ​ 这是一款开源的主机监控系统&#xff0c;可以支持主机各种指标监测&#xff08;cpu使用率&#xff0c;cpu温度&#xff0c;内存使用率&#xff0c;磁盘容量空间&#xff0c;磁盘IO&#xff0c;硬盘SMART健康状态&#xff0c;系统负载&#xff…

starrocks基于prometheus实现监控告警

监控报警 本文介绍如何为 StarRocks 设置监控报警。 StarRocks 提供两种监控报警的方案。企业版用户可以使用内置的 StarRocksManager&#xff0c;其自带的 Agent 从各个 Host 采集监控信息&#xff0c;上报至 Center Service&#xff0c;然后做可视化展示。StarRocksManager …

[陇剑杯 2021]之Misc篇(NSSCTF)刷题记录⑤

NSSCTF-Misc篇-[陇剑杯 2021] 日志分析:[陇剑杯 2021]日志分析&#xff08;问1&#xff09;[陇剑杯 2021]日志分析&#xff08;问2&#xff09;[陇剑杯 2021]日志分析&#xff08;问3&#xff09; 简单日志分析&#xff1a;[陇剑杯 2021]简单日志分析&#xff08;问1&#xff0…

Python制作一个自动发送弹幕的工具,让你看直播不冷场

前言 嗨喽&#xff0c;大家好呀~这里是爱看美女的茜茜呐 让我们先看看效果&#xff1a; 名字我就打码了&#xff0c;当然名字不是关键&#xff0c;我直接截图展示算了&#xff0c;GIF的话&#xff0c;太麻烦了。 环境使用: Python 3.8 / 编译器 Pycharm 2021.2版本 / 编辑器…

存在列排斥力的另一例证

( A, B )---3*30*2---( 1, 0 )( 0, 1 ) 让网络的输入只有3个节点&#xff0c;AB训练集各由5张二值化的图片组成&#xff0c;让A中有5个1&#xff0c;B中全是0&#xff0c;排列组合A的所有可能&#xff0c;统计迭代次数的顺序。其中有12组数据 A-B 迭代次数 1 0 1 5*4*2*1…

Inception 深度卷积神经网络(CNN)架构

Inception是一种深度卷积神经网络&#xff08;CNN&#xff09;架构&#xff0c;由Google在2014年提出。它是一种基于多尺度卷积的网络结构&#xff0c;旨在解决传统CNN在处理不同大小的输入图像时存在的问题。 Inception的主要特点是使用了多个不同尺度的卷积核来提取不同尺度…

API测试| 了解API接口测试| API接口测试指南(一)

什么是API&#xff1f; API是一个缩写&#xff0c;它代表了一个 pplication P AGC软件覆盖整个房间。API是用于构建软件应用程序的一组例程&#xff0c;协议和工具。API指定一个软件程序应如何与其他软件程序进行交互。 例行程序&#xff1a;执行特定任务的程序。例程也称为过…

人脸检测和行人检测2:YOLOv5实现人脸检测和行人检测(含数据集和训练代码)

人脸检测和行人检测2&#xff1a;YOLOv5实现人脸检测和行人检测(含数据集和训练代码) 目录 人脸检测和行人检测2&#xff1a;YOLOv5实现人脸检测和行人检测(含数据集和训练代码) 1. 前言 2. 人脸检测和行人检测数据集说明 &#xff08;1&#xff09;人脸检测和行人检测数据…

初识C++之左值引用与右值引用

目录 一、左值引用与右值引用 1. 左值和右值的概念 1.1 左值 1.2 右值 1.3 左值与右值的区分 2. 左值引用与右值引用 2.1 左值引用与右值引用的使用方法 2.2 左值引用的可引用范围 2.3 右值引用的可引用范围 3. 右值引用的作用 3.1 减少传值返回的拷贝 3.2 插入时的…

2023北京新一代信息技术应用融合创新人才发展峰会暨鲲鹏开发者创享日·北京站成功举办

以技术创新促产业发展&#xff0c;以开放使能筑人才根基 4月25日&#xff0c;由北京市经济和信息化局、北京市朝阳区人民政府、国家工业信息安全发展研究中心与华为技术有限公司联合主办&#xff0c;北京鲲鹏联合创新中心、北京市中小企业公共服务平台、中国软件行业协会承办的…

字节超全学习流程图流出,100天涨薪10k,从功能测试到自动化测试

今年年初&#xff0c;由于经济压力让我下定决心进阶自动化测试&#xff0c;已经24的我做了3年功能测试&#xff0c;坐标广州薪资定格在8k&#xff0c;可能是生活过的太安逸&#xff0c;觉得8000的工资也够了。 但是生活总是多变的&#xff0c;女朋友的突然怀孕&#xff0c;让我…

软件测试面试一定要看的面试题和笔试题全套教程

1、什么是软件测试&#xff1f;2’ 【要点】 在规定条件下对程序进行操作&#xff0c;以发现错误&#xff0c;对软件质量进行评估&#xff0c;包括对软件形成过程的文档、数据以及程序进行测试。 【详解】 软件测试就是在软件投入运行前对软件需求分析、软件设计规格说明书…