您现在的位置是：首页 > 数据库

当前栏目

Solr的TrieField范围查询分析

索引

2023-03-14 22:31:51 时间

solr从1.4版本开始，提供了一种字段类型TrieField（TrieLongField、TrieIntField等），用于范围查询，性能比普通的数值类型要快10倍。为什么会快那么多呢？网上找不到相关资料，通过分析源代码，大概了解了其原理，给大家分享下。

TrieField字段配置
<fieldType name=”tint” precisionStep=”8” omitNorms=”true” positionIncrementGap=”0”/>

其中precisionStep代表字段值分段保存的时候，截断精度的大小。一般来说，其值越小，索引大小越大，查找速度越快。

TrieField索引
TrieField字段在lucene中是用多个field来保存的，field的多少根据precisionStep决定，比如TrieIntField，precisionStep=”8”，则保存到索引中就是4个field，如图，32位的Int，每次缩进8位保存为一个field，新的field采用char数组来保存。因此索引的大小会比普通的IntField大。

TrieField的范围查询：
TrieField的范围查询通过高位范围匹配，低位边缘匹配，得到需要查询的term，再查询这些term得到docid来实现。

查找的过程：

1、将查找的范围A~B的上下界A、B值,取出最高8位，标记为A1、B1，到第一段找在(A1~B1)内的term，得到需要查找的termlist1

2、继续取A、B值的最高16位，标记为A2、B2，到第二段来查在(A2~A1 11111111]和[B1 11111111,B2)范围内的Term，得到termlist2

3、继续取A、B值的最高24位，标记为A3、B3，到第三段来查在(A3~A2 11111111]和[B2 11111111,B3)范围内的Term，得到termlist3

4、继续取A、B值的最高24位，也即A、B值，到第四段来查找[A~A3 11111111]和[B3 11111111,B]范围内的Term，得到termlist4

5、最后查询这些term，归并，就得到了符合查询条件的docid了。从上面的描述，我们可以看到，需要查询的term最多为254+2552+2552+256*2=1786个，传统的方式A~B个term要小的多，因此性能有很大的提升。

本文来源于"阿里中间件团队播客",原文发表时间" 2012-05-05 "

猜你喜欢

鲜为人知但很有用的 HTML 属性
在 Go 里用 CGO？这 7 个问题你要关注！
数据孤岛是业务效率的无声杀手
9款优秀的去中心化通讯软件 Matrix 的客户端
翻转再翻转！有意思的水平横向溢出滚动
发现 Linux SpaceFM 文件管理器的威力
图像处理工具Python扩展库，你了解吗？
求职数据分析，项目经验该怎么写
自定义计数器小技巧！CSS 实现长按点赞累加动画
在OKR中，我看到了数据驱动业务的未来
2023展望：新的一年将给大数据分析领域带来什么？
过五关！React高频面试题指南
阿里云ADB基于Hudi构建Lakehouse的实践
火山引擎云原生大数据在金融行业的实践
OpenHarmony富设备移植指南（二）—从postmarketOS获取移植资源
《数据成熟度指数》报告：64%的企业领袖认为大多数员工“不懂数据”
OpenHarmony 小型系统兼容性测试指南
肯睿中国（Cloudera）：2023年企业数字战略三大趋势预测
适用于 Linux 的十大命令行游戏
软件开发中的十个认知偏差

zl程序教程

当前栏目

Solr的TrieField范围查询分析

相关文章