博客
关于我
nodejs http小爬虫
阅读量:796 次
发布时间:2023-02-16

本文共 2073 字,大约阅读时间需要 6 分钟。

Node.js 小爬虫实践

爬虫是网络世界中的“探索者”,通过抓取网页代码获取各种数据。Node.js 生态中,利用 http 模块可以轻松实现简单的爬虫功能。

示例一:基础爬虫

var http = require('http');var url = "http://www.imooc.com/learn/348";http.get(url, function(res) {    var html = '';    res.on('data', function(data) {        html += data;    });    res.on('end', function() {        console.log(html);    });}).on('error', function() {    console.log('请求出错');});

将代码保存为 imooc-crawler.js,运行命令:

node imooc-crawler.js

注意:确保脚本路径正确。

示例二:增强功能

为了更好地抓取结构化数据,我们需要 cheerio 库,它类似于 jQuery,支持 DOM 操作。

安装依赖:

npm install cheerio

完成后,修改爬虫代码:

var http = require('http');var cheerio = require('cheerio');var url = "http://www.imooc.com/learn/348";function filterChapters(html) {    var $ = cheerio.load(html);    var courseData = [];        $('.learnchapter').each(function(item) {        var chapter = $(this);        var chapterTitle = chapter.find('strong').text();        var videos = chapter.find('.video').children('li');                var chapterData = {            title: chapterTitle,            videos: []        };                videos.each(function(item) {            var video = $(this).find('.studyvideo');            var videoTitle = video.text();            var id = video.attr('href').split('video/')[1];                        chapterData.videos.push({                title: videoTitle,                id: id            });        });                courseData.push(chapterData);    });        return courseData;}function printCourseInfo(courseData) {    courseData.forEach(function(item) {        console.log(item.title);        item.videos.forEach(function(video) {            console.log(' [' + video.id + '] ' + video.title);        });    });}http.get(url, function(res) {    var html = '';    res.on('data', function(data) {        html += data;    });    res.on('end', function() {        var courseData = filterChapters(html);        printCourseInfo(courseData);    });}).on('error', function() {    console.log('请求出错');});

将代码保存为 crawler.js,运行命令:

node crawler.js

个人总结

本次实践主要体验了 Node.js 爬虫开发的基础流程。通过 cheerio 学习了如何操作 DOM 结构,掌握了爬取网页内容的基础方法。

转载地址:http://xvjfk.baihongyu.com/

你可能感兴趣的文章
Node JS: < 二> Node JS例子解析
查看>>
Node Sass does not yet support your current environment: Windows 64-bit with Unsupported runtime(72)
查看>>
Node 裁切图片的方法
查看>>
Node+Express连接mysql实现增删改查
查看>>
node, nvm, npm,pnpm,以前简单的前端环境为什么越来越复杂
查看>>
Node-RED中Button按钮组件和TextInput文字输入组件的使用
查看>>
Node-RED中Switch开关和Dropdown选择组件的使用
查看>>
Node-RED中使用html节点爬取HTML网页资料之爬取Node-RED的最新版本
查看>>
Node-RED中使用JSON数据建立web网站
查看>>
Node-RED中使用json节点解析JSON数据
查看>>
Node-RED中使用node-random节点来实现随机数在折线图中显示
查看>>
Node-RED中使用node-red-browser-utils节点实现选择Windows操作系统中的文件并实现图片预览
查看>>
Node-RED中使用node-red-contrib-image-output节点实现图片预览
查看>>
Node-RED中使用node-red-node-ui-iframe节点实现内嵌iframe访问其他网站的效果
查看>>
Node-RED中使用Notification元件显示警告讯息框(温度过高提示)
查看>>
Node-RED中使用range范围节点实现从一个范围对应至另一个范围
查看>>
Node-RED中实现HTML表单提交和获取提交的内容
查看>>
Node-RED中将CSV数据写入txt文件并从文件中读取解析数据
查看>>
Node-RED中建立TCP服务端和客户端
查看>>
Node-RED中建立Websocket客户端连接
查看>>