php采集安装教程(Python数据采集流程)

  本篇文章给大家带来的内容是关于php中常用的采集函数的总结(附代码),有一定的参考价值,有需要的朋友可以参考一下,希望对你有所帮助。  这几天关注了一下PHP的采集程序,才发现用PHP采集内容是这么方便,

  本篇文章给大家带来的内容是关于php中常用的采集函数的总结(附代码),有一定的参考价值,有需要的朋友可以参考一下,希望对你有所帮助。

  「php」php中常用的采集函数的总结,值得收藏!(附代码)「php」php中常用的采集函数的总结,值得收藏!(附代码)这几天关注了一下PHP的采集程序,才发现用PHP采集内容是这么方便,把经常用到的采集函数在这里总结一下,方便以后使用!

  获取所有链接内容和地址

  function getAllURL($code){

  preg_match_all(‘/”‘ ]+)[“|’]?s*[^>]*>([^>]+)/i’,$code,$arr);

  return array(‘name’=>$arr[2],’url’=>$arr[1]);

  }

  获取所有的图片地址

  function getImgSrc($code){

  $reg = “/]*src=”(http://(.+)/(.+).(jpg|gif|bmp|bnp|png))”/isU”;

  preg_match_all($reg, $code, $img_array, PREG_PATTERN_ORDER);

  return $img_array[1];

  }

  当前的脚本网址

  function getSelfURL(){

  if(!empty($_SERVER[“REQUEST_URI”])){

  $scriptName = $_SERVER[“REQUEST_URI”];

  $nowurl = $scriptName;

  }else{

  $scriptName = $_SERVER[“PHP_SELF”];

  if(empty($_SERVER[“QUERY_STRING”])) $nowurl = $scriptName;

  else $nowurl = $scriptName.”?”.$_SERVER[“QUERY_STRING”];

  }

  return $nowurl;

  }

  把全角数字转为半角数字

  function getAlabNum($fnum){

  $nums = array(“0”,”1”,”2”,”3”,”4”,”5”,”6”,”7”,”8”,”9”);

  $fnums = “0123456789”;

  for($i=0;$i”,”>”,$txt);

  $txt = preg_replace(“/[rn]{1,}/isU”,”rn”,$txt);

  return $txt;

  }

  清除HTML标记

  function clearHtml($str){

  $str = str_replace(‘’,’>’,$str);

  return $str;

  }

  相对路径转化成绝对路径

  function relative2Absolute($content, $feed_url) {

  preg_match(‘/(http|https|ftp):///’, $feed_url, $protocol);

  $server_url = preg_replace(“/(http|https|ftp|news):///”, “”, $feed_url);

  $server_url = preg_replace(“//.*/”, “”, $server_url);

  if ($server_url == ”) {

  return $content;

  }

  if (isset($protocol[0])) {

  $new_content = preg_replace(‘/href=”//’, ‘href=”‘.$protocol[0].$server_url.’/’, $content);

  $new_content = preg_replace(‘/src=”//’, ‘src=”‘.$protocol[0].$server_url.’/’, $new_content);

  } else {

  $new_content = $content;

  }

  return $new_content;

  }

  获取指定标记中的内容

  function getTagData($str, $start, $end){

  if ( $start == ” || $end == ” ){

  return;

  }

  $str = explode($start, $str);

  $str = explode($end, $str[1]);

  return $str[0];

  }

  「php」php中常用的采集函数的总结,值得收藏!(附代码)「php」php中常用的采集函数的总结,值得收藏!(附代码)HTML表格的每行转为CSV格式数组

  function getTrArray($table) {

  $table = preg_replace(“‘]*?>’si”,’”‘,$table);

  $table = str_replace(“”,’”,’,$table);

  $table = str_replace(“”,”{tr}”,$table);

  //去掉 HTML 标记

  $table = preg_replace(“‘’si”,””,$table);

  //去掉空白字符

  $table = preg_replace(“‘([rn])[s]+’”,””,$table);

  $table = str_replace(” “,””,$table);

  $table = str_replace(” “,””,$table);

  $table = explode(“,{tr}”,$table);

  array_pop($table);

  return $table;

  }

  将HTML表格的每行每列转为数组,采集表格数据

  function getTdArray($table) {

  $table = preg_replace(“‘]*?>’si”,””,$table);

  $table = preg_replace(“‘]*?>’si”,””,$table);

  $table = preg_replace(“‘]*?>’si”,””,$table);

  $table = str_replace(“”,”{tr}”,$table);

  $table = str_replace(“”,”{td}”,$table);

  //去掉 HTML 标记

  $table = preg_replace(“‘’si”,””,$table);

  //去掉空白字符

  $table = preg_replace(“‘([rn])[s]+’”,””,$table);

  $table = str_replace(” “,””,$table);

  $table = str_replace(” “,””,$table);

  $table = explode(‘{tr}’, $table);

  array_pop($table);

  foreach ($table as $key=>$tr) {

  $td = explode(‘{td}’, $tr);

  array_pop($td);

  $td_array[] = $td;

  }

  return $td_array;

  }

  返回字符串中的所有单词 $distinct=true 去除重复

  function splitEnStr($str,$distinct=true) {

  preg_match_all(‘/([a-zA-Z]+)/’,$str,$match);

  if ($distinct == true) {

  $match[1] = array_unique($match[1]);

  }

  sort($match[1]);

  return $match[1];

  }

原创文章,作者:发布专员,如若转载,请注明出处:https://ziliaobaba.com/13614.html

(0)
发布专员发布专员
上一篇 2022年1月9日 22:20
下一篇 2022年1月9日 23:07

相关推荐

  • 怎么解除安全模式?如何关闭电脑安全模式

    不小心进到电脑的安全模式如何退出呢?可能有的朋友会有这样的疑问。有时候系统出现问题我们可以进入安全模式进行修复,但是很多小伙伴就不知道如何解除电脑系统安全模式,这里就和大家分享一下…

    2022年10月5日
  • 搬地摊卖什么最好?摆摊经验

    地摊一线战士,最近疫情还没结束闲着没事,整理下文章关于新手摆摊进军地摊界技巧,希望对新手朋友有帮助,关注我视频有更新,定期更新日常摆摊生活视频,2020年云贵川,赣粤我来了 言归正…

    2022年10月15日
  • 明年农村有什么大变化吗英语翻译

    Next year, the rural areas of our country will undergo great changes. In the past, the rur…

    投稿 2023年6月30日
  • 魅族m8怎么安装软件?魅族安装不了应用

    目前魅族已经在最新的固件包中删除了 Google 服务框架,这导致魅族用户无法登录 Google 账号,在使用 Google Play 等应用时也会出现「闪退」现象。不过用户们也无…

    2022年10月18日
  • 如何关闭爱奇艺自动续费?爱奇艺app关闭自动续费

    连续包月开了可以马上关。以爱奇艺为例,自动续费服务可以随时开通随时取消,可以在账号会员到期前在客户端进行取消。取消成功后,不影响此次已经开通成功的会员权益。如成功取消连续包月服务,…

    投稿 2021年11月13日
  • 口碑最好的孕妇奶粉品牌(孕妇奶粉品牌)

    直接告诉你,待产包小罐奶粉哪些值得买:   爱他美卓萃 国际妈咪APP参考价:155/380g   优博剖蓓舒 国际妈咪APP参考价:164/400g &nbs…

    2022年11月25日
  • 装修材料购买顺序是什么(10大好用品牌)

    今天继续和大家聊聊装修材料的哪些事,装修材料是家装中最重要的一个组成部分,很多人对于装修材料的选择都是战战兢兢,生怕选错了就不好了。今天小编和大家讲讲装修材料的购买顺序和市场上的现在比较火热的品牌推荐,不喜欢断断续续的写,就一次性把关于装修材料的全部写出来,大家看看哦~装修材料购买顺序1.设计进行中、施工前:确定好全包半包清包装修模式、设计开始一段时间后,可购买主材包括:橱柜、(中央)空

    2022年1月3日
  • 手机声音正常但微信没声音?微信听不到声音

    手机微信没有生意,开启微信“新消息通知”即可。 开启方法:微信设置→新消息通知→声音与振动开启   下面小编给大家说下具体操作方法: 1、手机开发微信,进入“我”个人信息…

    2022年10月20日
  • 微信小程序如何开发

    微信小程序开发技术正在发展迅速,它的出现大大改变了移动互联网的发展模式,让用户能够在微信中轻松访问各种服务,从而提高了用户体验。那么,如何开发一款微信小程序呢? ## 一、准备工作…

    投稿 2023年7月1日
  • 西安特产有什么?西安必买特产

    西安特产有周宜君核桃至猕猴桃、灞桥樱桃、横山大明绿豆、耿镇胡萝卜、耿镇胡萝卜、佳县油枣、靖边马铃薯、韩城大红袍花椒、镇安大板栗。其中灞桥樱桃颗粒饱满,果型硕大,果实呈肾形或宽心脏形…

    2022年11月18日