RSS解析器MagpieRSS笔记

2016-02-19 19:02 4 1 收藏

下面图老师小编要向大家介绍下RSS解析器MagpieRSS笔记,看起来复杂实则是简单的,掌握好技巧就OK,喜欢就赶紧收藏起来吧!

【 tulaoshi.com - Web开发 】

  MagpieRSS是一个不错的RSS抓取/解析工具,我本来打算自己写一个php的RSS解析工具,不过试了一下MagpieRSS,觉得还不错,能满足需要。

  顺便看了看代码,记点笔记。

  1.乱码问题

  MagpieRSS过去时常出现乱码问题,从0.7版本解决了这个问题

  Version0.7

  support for input and output charset encoding

(本文来源于图老师网站,更多请访问https://www.tulaoshi.com/webkaifa/)

  based on the work in FoF,uses iconv or mbstring if available

  0.7之后的版本可以指定输入和输出字符编码,然后使用iconv或mbstring函数进行编码转换。这个工作在create_parser函数里面完成的,如果两个函数都不存在,可以在RSS_fetch.inc中让MAGPIE_DETECT_ENCODING为false,不检测和转换编码,否则就会出错。

  一切正常的情况下,把RSS_fetch.inc中MAGPIE_OUTPUT_ENCODING定义成你需要的输出编码,比如UTF-8:define(‘MAGPIE_OUTPUT_ENCODING’,‘UTF-8’);就可以获得正确的输出结果了。

  2.抓取方法

  MagpieRSS用了Snoopy作为http客户端来抓取RSS。这个库比较完善,支持https,支持gzip。

  需要注意的是,Snoopy用exec命令调用curl,然后返回结果,而不是使用编译进php的curl函数。默认的路径是“/usr/bin/curl”,如果这里没有curl或是没有执行权限,就可能失败。不过只有https需要用到curl,普通的http访问是用fsockopen的。

  同时,Snoopy可以使用代理服务器,但是MagpieRSS没有使用,如果需要可以在RSS_fetch.inc中的_fetch_remote_file函数里面添加$client-proxy_host和$client-proxy_port。

  3.缓存

  MagpieRSS设置了一个默认3600秒超时的缓存。在./cache下放了一堆文件,文件名是md5之后的url+MAGPIE_OUTPUT_ENCODING,格式是php的serialize。

(本文来源于图老师网站,更多请访问https://www.tulaoshi.com/webkaifa/)

  所以cache目录要可写。超时时间在RSS_cache.inc的var$MAX_AGE=3600;这行设置,也可以在创建cache对象的时候设置。

  综合起来,这个库还是不错的,优点很多,也考虑了主机的各种情况,兼容性很好。函数形式的接口,很容易调用。不过应该先用head来取RSS的http header,根据Etag来判断是否抓整个页面回来,这样效率还能再有提高。这个改动之后,cache就可以存在更长的时间,而不是一个固定的3600秒。同时我比较想把文章保存起来,以便以后用,这就需要数据库了。

  我将来应该会基于这个东西发布一个新版本,把我想要的功能加进来。

来源:https://www.tulaoshi.com/n/20160219/1619869.html

延伸阅读
标签: 浏览器
IE浏览器内置的RSS订阅源 使用 RSS 订阅源 要通过 RSS 订阅源阅读更新信息,得分两步走。 找一个源阅读器。 这个大部分都是免费的;IE7、IE8 都有内置的源阅读器,可以直接使用。 添加RSS订阅源。 这个要重点说一说。我们打开一个网页后,如果 Internet Explorer 中的 RSS 订阅源图标 亮起,则表明该站点提供订阅...
小清新RSS阅读器“Newsify”评测 是iOS 平台上一款通用版 RSS 阅读器应用。和很多老牌离线阅读应用不同,走的是简洁实用,注重排版美观的小清新路线,抓取出文中的图片和摘要,重新排版,让用户每天打开应用就像读报一样。 软件要用Google账号登陆,同步订阅文章才能使用。一进来的分类列表界面和其它 RSS 阅读器差不多:淡淡的灰...
标签: PHP
此文章原文转自:http://blog.csdn.net/guoguo1980/archive/2006/08/18/1095523.aspx 此文章作者: guoguo1980   【导读】想象使用一个简单HTML文件来把一个请求发送到一个服务器端脚本,收到一个基于该请求的定制XML文件,然后把它显示给用户而几乎不需要刷新浏览器!本文作者将同你一起探讨怎样在普通Web应用程序中...
  RSS聚合器是一种特别适合于使用标准AJAX引擎进行构建的应用程序,然而,要实现对RSS回馈的跨域的AJAX请求往往是很难的。在本文中,我将向你展示如何利用一个简单的PHP函数来实现"桥接"AJAX引擎和RSS内容。 一、 引言 现在,开发一个RSS聚合器已经不再是困难的事情,但是开发一个高质量的RSS聚合器却仍然存在相当的难...
标签: PHP
新手如何使用 PHP 创建RSS阅读器     Jacques Noah在Devshed上发表了一篇关于在PHP4与任意版本的 Mysql 搭建的平台下创建一个基于PHP的RSS阅读器的文章,RSS文档中有三个主要的标签:Title,link和description,分别包含着像它们名称提示一样的信息。     Jacques列举了来自一个RSS文档的两段代码...

经验教程

458

收藏

91
微博分享 QQ分享 QQ空间 手机页面 收藏网站 回到头部