IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> PHP知识库 -> 使用 Symfony DomCrawler 进行爬虫 已解决 -> 正文阅读

[PHP知识库]使用 Symfony DomCrawler 进行爬虫 已解决

?在使用 symfony 中。有需求需要对页面元素进行 爬虫。 一开始 计划其他办法。 但是 好在symfony有官方 爬虫组件。 索性看文档 直接 就可以使用。?

 $url = $this->baseUrl . $list->getApiUrL();

        $response = file_get_contents($url);

        $crawler = new Crawler();

        $crawler->addHtmlContent($response);

        $data = [];
        try {
            //使用crawler进行页面内容分析
            $content = $crawler->filterXPath('//ul[contains(@class,"conte_heliu_ul")]')->text();

            $imgSrc = $crawler->filterXpath('//img')->extract(array('src'));

            $name = $crawler->filterXPath('//ul[contains(@class,"conte_heliu_ul")]/li')->each(function (Crawler $node, $i) use (&$data) {
                $item = $node->filterXPath('//div/span')->text();
                $city = $node->filterXPath('//span')->text();
                return $city . '-' . $item;
            });

            $userName = implode(',', $name);

            $imgUrl = str_replace('../', '', $imgSrc[0]);
            $url = str_replace('3g/', '', $this->baseUrl);

            $fileUrl = '';
            if (!empty($imgUrl)) {
                $fileUrl = $url . $imgUrl;
            }
            $data = [
                'content' => $content,
                'userName' => $userName,
                'img' => $fileUrl,
            ];

        } catch (Exception $e) {
            $output->writeln('error ');
        }

use Symfony\Component\DomCrawler\Crawler;

function run()
{
? ? //伪造浏览器UA
? ? $headers = [
? ? ? ? 'user-agent' => 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36',
? ? ];
? ? $client = new Client([
? ? ? ? 'timeout' => 20,
? ? ? ? 'headers' => $headers
? ? ]);
? ? //发送请求获取页面内容
? ? $response = $client->request('GET', $url)->getBody()->getContents();

? ? $data = [];
? ? $crawler = new Crawler();
? ? $crawler->addHtmlContent($response);

? ? //使用crawler进行页面内容分析
? ? try{
? ? ? ? //这里使用的是xpath语法,轮询forFlow子类day中的元素,既页面上每一篇文章的块状元素,并且进行内容获取
? ? ? ? $crawler->filterXPath('//div[contains(@class, "forFlow")]/div[contains(@class, "day")]')->each(function(Crawler $node, $i) use (&$data){
? ? ? ? ? ? $item = [
? ? ? ? ? ? ? ? 'date' => $node->filterXPath('//div[contains(@class, "dayTitle")]/a')->text(),
? ? ? ? ? ? ? ? 'title' => $node->filterXPath('//div[contains(@class, "postTitle")]/a')->text(),
? ? ? ? ? ? ? ? 'abstract' => $node->filterXPath('//div[contains(@class, "postCon")]/div')->text(),
? ? ? ? ? ? ? ? 'url' => $node->filterXPath('//div[contains(@class, "postCon")]/div/a')->attr('href'),
? ? ? ? ? ? ];
? ? ? ? ? ? $data[] = $item;
? ? ? ? });
? ? }catch (\Exception $e){
? ? ? ? echo $e->getMessage() . PHP_EOL;
? ? }
? ? //打印结果
? ? print_r($data);
}

  PHP知识库 最新文章
Laravel 下实现 Google 2fa 验证
UUCTF WP
DASCTF10月 web
XAMPP任意命令执行提升权限漏洞(CVE-2020-
[GYCTF2020]Easyphp
iwebsec靶场 代码执行关卡通关笔记
多个线程同步执行,多个线程依次执行,多个
php 没事记录下常用方法 (TP5.1)
php之jwt
2021-09-18
上一篇文章      下一篇文章      查看所有文章
加:2022-03-22 20:18:59  更:2022-03-22 20:19:48 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年12日历 -2024/12/26 16:30:16-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码
数据统计