设为首页 收藏本站
查看: 742|回复: 0

[经验分享] Python之正则

[复制链接]

尚未签到

发表于 2017-4-23 09:48:59 | 显示全部楼层 |阅读模式
  从学习Python至今,发现很多时候是将Python作为一种工具。特别在文本处理方面,使用起来更是游刃有余。
  说到文本处理,那么正则表达式必然是一个绝好的工具,它能将一些繁杂的字符搜索或者替换以非常简洁的方式完成。
  我们在处理文本的时候,或是查询抓取,或是替换.

一.查找
  如果你想自己实现这样的功能模块,输入某一个ip地址,得到这个ip地址所在地区的详细信息.
  然后你发现http://ip138.com
可以查出很详细的数据
  但是人家没有提供api供外部调用,但是我们可以通过代码模拟查询然后对结果进行抓取.
  通过查看这个相应页面的源码,我们可以发现,结果是放在三个<li></li>中的

<table width="80%"  border="0" align="center" cellpadding="0" cellspacing="0">
<tr>
<td align="center"><h3>ip138.com IP查询(搜索IP地址的地理位置)</h3></td>
</tr>
<tr>
<td align="center"><h1>您查询的IP:121.0.29.231</h1></td>
</tr>
<tr>
<td align="center"><ul class="ul1"><li>本站主数据:浙江省杭州市 阿里巴巴</li><li>参考数据一:浙江省杭州市 阿里巴巴</li><li>参考数据二:浙江省杭州市 阿里巴巴</li></ul></td>
</tr>
<tr>
<td align="center">如果您发现查询结果不详细或不正确,请使用<a href="ip_add.asp?ip=121.0.29.231"><font color="#006600"><b>IP数据库自助添加</b></font></a>功能进行修正<br/><br/>
<iframe src="/jss/bd_460x60.htm" frameborder="no" width="460" height="60" border="0" marginwidth="0" marginheight="0" scrolling="no"></iframe><br/><br/></td>
</tr>
<form method="get" action="ips8.asp" name="ipform" >
<tr>
<td align="center">IP地址或者域名:<input type="text" name="ip" size="16"> <input type="submit" value="查询"><input type="hidden" name="action" value="2"></td>
</tr><br>
<br>
</form>
</table>

   如果你了解正则表达式你可能会写出

正则表达式

(?<=<li>).*?(?=</li>)

   这里使用了前瞻:lookahead 后顾: lookbehind,这样的好处就是匹配的结果中就不会包含html的li标签了.
  如果你对自己写的正则表达式不是很自信的话,可以在一些在线或者本地的正则测试工具进行一些测试,以确保正确.
  接下来的工作就是如果用Python实现这样的功能,首先我们得将正则表达式表示出来:

r"(?<=<li>).*?(?=</li>)"
  Python中字符串前面加上前导r这个字符,代表这个字符串是R
aw String(原始字符串),也就是说Python字符串本身不会对字符串中的字符进行转义.这是因为正则表达式也有转义字符之说,如果双重转义的话,易读性很差.
  这样的串在Python中我们把它叫做"regular expression pattern"
  如果我们对pattern进行编译的话

prog = re.compile(r"(?<=<li>).*?(?=</li>)")
   我们便可以得到一个正则表达式对象regular expression object,通过这个对象我们可以进行相关操作.
  比如

result=prog.match(string)
##这个等同于
result=re.match(r"(?<=<li>).*?(?=</li>)",string)
##但是如果这个正则需要在程序匹配多次,那么通过正则表达式对象的方式效率会更高
  接下来就是查找了,假设我们的html结果已经以html的格式存放在text中,那么通过

result_list = re.findall(r"(?<=<li>).*?(?=</li>)",text)
   便可以取得所需的结果列表.

二.替换
  使用正则表达式进行替换非常的灵活.
  比如之前我在阅读Trac这个系统中wiki模块的源代码的时候,就发现其wiki语法的实现就是通过正则替换进行的.
  在使用替换的时候会涉及到正则表达式中的Group分组的概念.
  假设wiki语法中使用!表示转义字符即感叹号后面的功能性字符会原样输出,粗体的语法为

写道

'''这里显示为粗体'''
  那么有正则表达式为

r"(?P<bold>!?''')"
  
  这里的?P<bold>是Python正则语法中的一部分,表示其后的group的名字为"bold"
  下面是替换时的情景,其中sub函数的第一个参数是pattern,第二个参数可以是字符串也可以是函数,如果是字符串的话,那么就是将目标匹配的结果替换成指定的结果,而如果是函数,那么函数会接受一个match object的参数,并返回替换后的字符串,第三个参数便是源字符串.

result = re.sub(r"(?P<bold>!?''')", replace, line)
   每当匹配到一个三单引号,replace函数便运行一次,可能这时候需要一个全局变量记录当前的三单引号是开还是闭,以便添加相应的标记.
  在实际的trac wiki的实现的时候,便是这样通过一些标记变量,来记录某些语法标记的开闭,以决定replace函数的运行结果.
  --------------------
  写的有点粗,改日补详细.

运维网声明 1、欢迎大家加入本站运维交流群:群②:261659950 群⑤:202807635 群⑦870801961 群⑧679858003
2、本站所有主题由该帖子作者发表,该帖子作者与运维网享有帖子相关版权
3、所有作品的著作权均归原作者享有,请您和我们一样尊重他人的著作权等合法权益。如果您对作品感到满意,请购买正版
4、禁止制作、复制、发布和传播具有反动、淫秽、色情、暴力、凶杀等内容的信息,一经发现立即删除。若您因此触犯法律,一切后果自负,我们对此不承担任何责任
5、所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其内容的准确性、可靠性、正当性、安全性、合法性等负责,亦不承担任何法律责任
6、所有作品仅供您个人学习、研究或欣赏,不得用于商业或者其他用途,否则,一切后果均由您自己承担,我们对此不承担任何法律责任
7、如涉及侵犯版权等问题,请您及时通知我们,我们将立即采取措施予以解决
8、联系人Email:admin@iyunv.com 网址:www.yunweiku.com

所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其承担任何法律责任,如涉及侵犯版权等问题,请您及时通知我们,我们将立即处理,联系人Email:kefu@iyunv.com,QQ:1061981298 本贴地址:https://www.yunweiku.com/thread-368043-1-1.html 上篇帖子: [转]新手该如何学python,怎么学好python? 下篇帖子: 浅谈 Python WSGI
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

扫码加入运维网微信交流群X

扫码加入运维网微信交流群

扫描二维码加入运维网微信交流群,最新一手资源尽在官方微信交流群!快快加入我们吧...

扫描微信二维码查看详情

客服E-mail:kefu@iyunv.com 客服QQ:1061981298


QQ群⑦:运维网交流群⑦ QQ群⑧:运维网交流群⑧ k8s群:运维网kubernetes交流群


提醒:禁止发布任何违反国家法律、法规的言论与图片等内容;本站内容均来自个人观点与网络等信息,非本站认同之观点.


本站大部分资源是网友从网上搜集分享而来,其版权均归原作者及其网站所有,我们尊重他人的合法权益,如有内容侵犯您的合法权益,请及时与我们联系进行核实删除!



合作伙伴: 青云cloud

快速回复 返回顶部 返回列表