其他教程

其他教程

Products

当前位置:首页 > 其他教程 >

火车头采集教程 数据处理教程 标签纯正则替换功能

GG网络技术分享 2025-03-18 16:10 1


内容采集规则

数据处理

对从内容页面提取的数据进行进一步处理,可以同时添加多个操作,按照从上到下的顺序来执行。

也就是说,上个步骤的结果会作为下个步骤的参数。

1)提取内容为空:如果提取内容为空,则使用正则匹配从原始页面中再次提取

2)内容替换/排除:将采集到的内容进行字符串替换,如需排除,则替换为空字符串即可

3)html标签过滤:过滤指定html标签,比如<a ,<font

4)字符截取:通过开始和结束字符串对内容进行截取

5)纯正则替换:通过强大的正则表达式进行复杂的替换。

在标签编辑的界面,数据处理那里点击添加,然后选择纯正则替换如下图:

clip_image004

界面如下:

clip_image006

原正则表达式:用正则把需要的部分和不需要的部分分开表示出来,不同部分用括号区分开来

替换后表达式:把需要的那部分放到这里,也可以随意写些别的组合在这里,用采集器自带的表示方式 $1 $2 $数字表示

clip_image008

比如上图我们要从标题里面使用正则把“清纯女生”四个字给提取出来。

使用正则把标题给表示出来如下图:

clip_image010

原理是:用最简单的正则,前面3个汉字做为一组,中间4个汉字做为一组,剩下的是一组。每一组用括号()区分,我们要的是第二组,那么替换后表达式就直接写$2 ,如果要第一组就是$1

按照顺序以此类推。当然正则表达式可以有很多种,小芳也是正则白痴,只能用这种简单的方式来做,高手可以写更好的表达式,原理都是一样的。

采集器里面使用正则的规律就是上面说的那样,先用正则分开表示,用括号区分开来,然后用$1 $2 $数字按照前后顺序依次对应表示结果。

看下测试结果:

clip_image012

测试结果是对的。

6)数据转换:包括将结果简转繁、将结果繁转简、自动转化为拼音和时间修正转化

7)智能提取:包括提取第一张图片、智能提取时间、智能提取邮箱、智能提取手机号码、智能提取电话号码

8)高级功能:包括自动摘要、自动分词、Http请求、字符编码转换、同义词替换、空内容缺省值、内容加前后缀、随机插入、运行C#代码、批量内容替换,统计标签字符串长度等一系列功能。

9)补全单网址:将当前内容作为一个网址进行补全。

10)文件下载:可以自动探测并下载文件,可设置下载路径和文件名样式。

11)内容过滤:对于一些不符合条件的记录,可以通过设置内容过滤来删除或标记为未采。
43

标签:

提交需求或反馈

Demand feedback