IT数码 购物 网址 头条 软件 日历 阅读 图书馆
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
图片批量下载器
↓批量下载图片,美女图库↓
图片自动播放器
↓图片自动播放器↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁
 
   -> 大数据 -> 关于搜索elasticsearch的数据条数大于10000的坑 max_result_window的解决方案 -> 正文阅读

[大数据]关于搜索elasticsearch的数据条数大于10000的坑 max_result_window的解决方案

关于这个问题我主要从5.6.x版本和7.10.x版本分析:

  • 5.6.x版本:只需要一步即可
{
    "settings": {
      "index": {     
        "number_of_shards": "1",
        "max_result_window": "1000000",
        "analysis": {
          "analyzer": {
            "keep_none_chinese_in_joined_full_pinyin_analyzer": {
              "tokenizer": "keep_none_chinese_in_joined_full_pinyin"
            }
          },
          "tokenizer": {
            "keep_none_chinese_in_joined_full_pinyin": {
              "keep_joined_full_pinyin": "true",
              "lowercase": "true",
              "none_chinese_pinyin_tokenize": "false",
              "keep_none_chinese_in_joined_full_pinyin": "true",
              "keep_original": "false",
              "keep_first_letter": "false",
              "keep_separate_first_letter": "false",
              "trim_whitespace": "false",
              "type": "pinyin",
              "keep_none_chinese": "true",
              "keep_full_pinyin": "false"
            }
          }
        },
        "number_of_replicas": "1"
        
      }
  }
}

以上是我在5.6.16的es中设置的setting, 其中参数 "max_result_window": "1000000" 的设置 返回最大1000000条数据。如果你需要更大的可以设置成Integer.MAX_VALUE;

看看效果:

GET test/_search
{
  "size": 0, 
  "query": {
    "match_all": {}
  }
}
------
{
  "took": 0,
  "timed_out": false,
  "_shards": {
    "total": 1,
    "successful": 1,
    "skipped": 0,
    "failed": 0
  },
  "hits": {
    "total": 29084,
    "max_score": 0,
    "hits": []
  }
}

可以看到total :??29084

  • 7.10.0 版本:需要两步才能实现

第一步:设置setting

{
  "settings": {
    "analysis": {
      "filter": {
        "my_synonym": {
          "type": "synonym",
          "synonyms_path": "analysis/synonym.txt"
        }
      },
      "analyzer": {
        "keep_none_chinese_in_joined_full_pinyin_analyzer": {
          "tokenizer": "keep_none_chinese_in_joined_full_pinyin"
        },
        "my_ik_max_word": {
          "tokenizer": "ik_max_word",
          "filter": [
            "my_synonym"
          ]
        },
        "my_ik_smart": {
          "tokenizer": "ik_smart",
          "filter": [
            "my_synonym"
          ]
        }
      },
      "normalizer": {
        "lowercase": {
          "type": "custom",
          "filter": [
            "lowercase"
          ]
        }
      },
      "tokenizer": {
        "keep_none_chinese_in_joined_full_pinyin": {
          "type": "pinyin",
          "keep_first_letter": false,
          "keep_separate_first_letter": false,
          "keep_none_chinese_in_joined_full_pinyin": true,
          "keep_joined_full_pinyin": true,
          "keep_none_chinese": true,
          "none_chinese_pinyin_tokenize": false,
          "keep_full_pinyin": false,
          "keep_original": false,
          "trim_whitespace": false,
          "lowercase": true
        }
      }
    },
    "index": {
      "max_result_window": 1000000,
      "number_of_shards": 1,
      "number_of_replicas": 1
    }
  },
  "mappings": {
    "dynamic_templates": [
      {
        "strings": {
          "match_mapping_type": "string",
          "mapping": {
            "type": "text",
            "fields": {
              "synonym_ik": {
                "type": "text",
                "store": false,
                "analyzer": "my_ik_max_word",
                "search_analyzer": "ik_smart"
              },
              "ik": {
                "type": "text",
                "store": false,
                "analyzer": "ik_max_word",
                "search_analyzer": "ik_smart"
              },
              "raw": {
                "type": "keyword",
                "normalizer": "lowercase"
              },
              "py": {
                "type": "text",
                "store": false,
                "fielddata": "true",
                "analyzer": "keep_none_chinese_in_joined_full_pinyin_analyzer"
              }
            }
          }
        }
      }
    ]
  }
}

同5.6.16一样需要设置 "max_result_window": "1000000" 我看看查询:


GET test/_search
{
  "size": 0, 
  "query": {
  "match_all": {}
  }
}
-------
{
  "took" : 1,
  "timed_out" : false,
  "_shards" : {
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : {
    "total" : {
      "value" : 10000,
      "relation" : "gte"
    },
    "max_score" : null,
    "hits" : [ ]
  }
}

我们查询返回最大total依然是es的默认值10000,注意此时:relation是gte 大于的意思;

所以我们需要:

GET test/_search
{
  "size": 0, 
  "track_total_hits": true, 
  "query": {
  "match_all": {}
  }
}
-----------
{
  "took" : 0,
  "timed_out" : false,
  "_shards" : {
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : {
    "total" : {
      "value" : 29087,
      "relation" : "eq"
    },
    "max_score" : null,
    "hits" : [ ]
  }
}

返回的total是29087满足需求了,此时的relation是eq 等于的意思;

ok?

  大数据 最新文章
实现Kafka至少消费一次
亚马逊云科技:还在苦于ETL?Zero ETL的时代
初探MapReduce
【SpringBoot框架篇】32.基于注解+redis实现
Elasticsearch:如何减少 Elasticsearch 集
Go redis操作
Redis面试题
专题五 Redis高并发场景
基于GBase8s和Calcite的多数据源查询
Redis——底层数据结构原理
上一篇文章      下一篇文章      查看所有文章
加:2021-07-29 23:27:58  更:2021-07-29 23:28:23 
 
开发: C++知识库 Java知识库 JavaScript Python PHP知识库 人工智能 区块链 大数据 移动开发 嵌入式 开发工具 数据结构与算法 开发测试 游戏开发 网络协议 系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑 笔记本 显卡 显示器 固态硬盘 硬盘 耳机 手机 iphone vivo oppo 小米 华为 单反 装机 图拉丁

360图书馆 购物 三丰科技 阅读网 日历 万年历 2024年5日历 -2024/5/3 11:30:58-

图片自动播放器
↓图片自动播放器↓
TxT小说阅读器
↓语音阅读,小说下载,古典文学↓
一键清除垃圾
↓轻轻一点,清除系统垃圾↓
图片批量下载器
↓批量下载图片,美女图库↓
  网站联系: qq:121756557 email:121756557@qq.com  IT数码