Easysearch
〖搜索客社区日报〗第2302期 (2026-09-21)
社区日报 • Muses 发表了文章 • 0 个评论 • 118 次浏览 • 13 小时前
Easysearch 原生集成国密算法:打造全链路自主可控搜索底座(二)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 1064 次浏览 • 2 天前

从 2.1.0 版本开始,INFINI Easysearch 内置了对国密(SM2/3/4)算法的支持,实现了全链路国密合规,满足等保及商用密码应用安全性评估要求。本篇以 Kylin-Server V11 操作系统和 Easysearch 2.3.0 进行演示。
Linux 主机安装 Tongsuo
Easysearch 基于 铜锁(Tongsuo)提供国密 TLCP 双证书能力,支持 SM2/SM3/SM4 加密套件。下载完 Easysearch 软件包后解压进目录,执行脚本安装铜锁。
bin/install-tongsuo-local.sh --version 8.4.0

安装完后会有提示切换到铜锁。

能正常查看版本信息,说明安装、切换都正常。

一键初始化(单节点 TLCP)
如需在单节点场景快速完成证书生成、TLCP 配置写入和初始密码设置,可直接使用:
EASYSEARCH_INITIAL_ADMIN_PASSWORD='EasysearchP@ssw0rd!' bin/initialize.sh --tlcp -s
执行上面的脚本会自动生成证书,修改 easysearch.yml 证书设置。



启动 Easysearch
从 Easysearch 的启动日志中可看到国密(Chinese SM algorithms)正常加载,并用来创建 SSLContext 。

客户端:用国密栈访问
curl 默认链接的 OpenSSL 密码库不支持国密协议(TLCP),因此 curl 访问 Easysearch 服务时加密协议最终回落到标准 TLS 1.3,套件为国际通用的 TLS_AES_128_GCM_SHA256。

用 Easysearch 发行包自带的 bin/tlcp-curl.sh 访问 Easysearch,可以看到加密套件是国密 TLS_SM4_GCM_SM3。

Java 应用默认使用的 OpenJDK 没有内置国密算法支持,所以不能直接走国密加密;要么换成支持国密的 JDK,要么在现有 JDK 中额外引入并注册国密算法实现。

相关阅读
Easysearch 2.4.0 发布:原生 HNSW 与混合检索,管理体验全面升级
资讯动态 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 1057 次浏览 • 2 天前

INFINI Easysearch 2.4.0 正式发布。本版本将向量搜索纳入内核:基于 Lucene 的原生 HNSW,关键词与语义向量可混合检索。控制台新增可视化 Mapping 编辑器,集群设置可同时查看临时、持久、默认三层配置。生命周期策略、可搜索快照、密钥库与插件管理同步更新,高并发下的字段使用统计和磁盘用量分析也更稳定。
主要更新如下:
功能特性 (Features)
原生 HNSW 向量搜索与混合检索
- 内置基于 Lucene 的 HNSW 向量索引。新建索引可直接使用
dense_vector、query-levelknn和顶层knn,无需安装 k-NN 插件。 - 支持 1~4096 维
float向量,以及cosine、dot_product、l2_norm、max_inner_product四种相似度算法。 - 支持通过
m、ef_construction和num_candidates调整索引构建与查询效果;省略index_options时默认使用hnsw(m=16, ef_construction=100)。 - 支持一个顶层关键词
query与一个顶层knn并列执行,通过结果并集与加权评分实现关键词、语义向量的混合召回。 - 兼容 Elasticsearch 8.19.17 的 float HNSW mapping、Bulk、kNN 查询和 wire 行为,以及 Elasticsearch Java 8.19.17、Python 8.19.3 官方客户端,现有应用可直接对接。
更多用法及兼容边界请参阅原生 HNSW 搜索文档。
可视化 Mapping 编辑器
新增索引页提供可视化 Mapping 编辑器。字段按层级排列成树,可直接编辑类型和参数,无需手写 Mapping JSON。

- 可以从索引模板或已有索引导入配置。创建索引时,也可以关联集群里已有的别名。
- 覆盖全部字段类型。支持多字段,也可为
object/nested添加子字段,同类型字段可批量添加。 - 可视化编辑与 JSON 编辑可随时切换,内容保持同步。
dynamic_templates、_source、_meta等高级内容在切换后仍会保留。
操作步骤见新增索引。
集群设置页
在「设置」中打开集群设置页,查看和修改 _cluster/settings 中的动态配置。页面按节点、索引、分片、断路器、生命周期分组,支持按名称或 key 搜索,也可按临时、持久、默认来源过滤。

- 每个设置有三层值:临时、持久、默认。优先级是临时 > 持久 > 默认。徽标标出当前生效的那一层。
- 布尔和枚举使用下拉框,数字使用数字输入,时间、大小等带单位的值直接填写,例如
60s、40mb。临时层与持久层可一次保存。支持清除单层,也可一键清空全部临时设置。 - 日志级别、分片分配属性、断路器等名称不固定的设置,可先添加实例,再填写取值。

操作步骤见集群设置。
数据管理与分析体验
- 数据探索改用 PIT(Point in Time)分页导出,导出数量不再受
max_result_window限制。 - 生命周期策略编辑器可配置的 action 更多,未填写的字段保持原有语义。
- 快照恢复支持直接恢复为可搜索快照,索引列表增加可搜索快照标识。
- 节点页面新增密钥库管理,插件列表支持从文件夹或 ZIP 包手动上传插件。这两项需先在右上角连接 Agent 后使用。
- 创建 API Token 或角色时,索引权限支持下拉选择和搜索。
rate聚合新增sum、value_count计算模式,并支持在包含单一日期源的composite聚合中计算速率。- DevTools 现支持 SQL 关键词高亮、补全和多行语句解析,查询结果默认返回 CSV。
- 生命周期(ILM)策略管理: 对生命周期策略编辑 UI 进行了全面增强,新建与编辑策略现已支持完整的 action 配置,覆盖 Hot、Warm、Cold、Delete 四个阶段
改进优化 (Improvements)
- 重构
_disk_usage同步分析链路,引入有界请求调度和独立线程池,降低并发磁盘用量分析对普通分析请求的影响。 - 重构
_field_usage_stats的 shard 级字段访问采集链路,按每次查询会话对相同字段和访问类型去重,完善 stored fields、term vectors、can-match、refresh/reopen 及主副分片场景的统计覆盖。 - 优化字段使用统计在高并发查询和大字段 registry 场景下的会话提交与快照生成,减少处理开销和临时对象分配。
问题修复 (Bug Fixes)
- 统一重构 Model Provider、Rules 与 Audit Log 的受保护内部索引权限过滤机制,修复直连、通配符、混合索引及数据流后备索引等场景下过滤语义不一致的问题;无权限用户直接访问受保护资源时会被拒绝,在混合或通配符请求中则隐藏相关资源,同时保留远程索引表达式和 Audit Log 的角色授权语义。
- 修复 Remote Reindex 对远端 Elasticsearch REST 协议版本判断不准确的问题,恢复 Elasticsearch 6.8.x、7.x 和 8.x 场景下 scroll 与 clear-scroll 请求的正确格式。
- 修复删除关联多个索引的别名失败的问题。
- 修复授权弹窗打开后「授权提示」页签可能自动消失的问题。
- 修复未授权状态显示为不规范英文的问题,现按界面语言显示「未授权 / Unlicensed」。
- 修复创建用户、角色、管道、模板、远程集群、快照仓库、自动跟随模式、规则库时重名可能覆盖已有配置的问题,现在会提示名称已存在。
- 修复编辑管道时可修改名称导致旧管道残留的问题,编辑时名称改为不可修改。
- 修复删除管道确认弹窗文案误写为「模板」的问题。
- 修复列表页左侧聚合过滤侧边栏输入关键字后无法筛选的问题。
- 修复分片列表点击刷新不重新加载数据的问题。
- 修复热点线程页面选择不支持的 gpu/mem 类型后列表为空且无提示的问题,下拉现仅提供受支持的类型。
- 修复创建角色无法选择粗粒度 action group,以及集群权限与索引权限被强制必填的问题。
- 修复数据探索导出超过 10000 条文档失败的问题。
- 移除生命周期策略编辑器中错误的节点标签缺失实时提醒。
- 修复节点详情插件页显示集群级安装状态的问题:插件只装在部分节点时,未安装的节点也会显示「已安装」;现在按当前节点过滤。
- 修复删除生命周期策略时确认弹窗不显示策略名的问题。
- 修复删除快照确认弹窗误用「策略」且不显示快照名的问题。
- 修复创建生命周期策略时前端重名校验不生效的问题。
升级提示
- 原生 HNSW 的已索引
dense_vector字段只能添加到由 2.4.0 或更高版本创建的索引,且所有数据节点均需升级到 2.4.0 或更高版本;旧索引需新建目标索引后通过 Reindex 迁移。 - 旧 k-NN 插件的
knn_dense_float_vector、knn_sparse_bool_vector和knn_nearest_neighbors接口继续保留,但新旧字段与查询语法不能混用。 - Easysearch 2.4.0 使用未量化的 float HNSW,当前不支持
int8_hnsw等量化向量类型。通过 Elasticsearch 8.19 官方客户端访问时,需在所有节点设置elasticsearch.api_compatibility: true和elasticsearch.api_compatibility_version: "8.19.17",并重启节点。
以上为本版本重点更新摘要,完整变更与技术细节请查看 Easysearch 产品 Release Notes 或联系我们的技术支持团队
获取新版本
INFINI Easysearch v2.4.0 已正式发布,欢迎升级体验:
- 下载地址:https://infinilabs.cn/download/
- 快速开始:https://docs.infinilabs.com/easysearch/main/docs/quick-start/
关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。

【搜索客社区日报】第2274期 (2026-07-27)
社区日报 • Muses 发表了文章 • 0 个评论 • 2565 次浏览 • 5 天前
【搜索客社区日报】第2298期 (2026-09-14)
社区日报 • Muses 发表了文章 • 0 个评论 • 4412 次浏览 • 2026-09-14 07:37
【搜索客社区日报】第2296期 (2026-09-07)
社区日报 • Muses 发表了文章 • 0 个评论 • 7488 次浏览 • 2026-09-07 14:40
Easysearch 原生集成国密算法:打造全链路自主可控搜索底座(一)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11684 次浏览 • 2026-08-28 19:51

国密算法:藏在手机里的"中国锁"
你有没有想过,每次扫码付款、刷身份证进站、在政务 App 上查社保时,是谁在背后保护你的信息安全?
答案可能比你想象得更"国产"——它叫国密算法。你可以把它理解成一套完全国产自研的"数字锁"。
什么是国密?
"国密"是国家商用密码的简称,由国家密码管理局制定管理。
打个比方:以前咱家装锁,大多是国外品牌,钥匙齿形设计也是人家的专利。万一厂家留了后门,你家大门就等于敞开了。国密算法干的活儿,就是给整个数字社会换上一把完全国产、自主可控的"中国锁"。
这个"锁具家族"成员不少:
SM2:负责数字签名,相当于给数据盖防伪章;
SM3:负责生成"数字指纹",谁改了一个字都能被发现;
SM4:负责把数据搅成乱码,只有对的人才能还原;
SM9:更神奇,直接用手机号或邮箱就能加密。
注:SM = "商密"拼音首字母,不是什么神秘代号 😄
国密到底保护了什么?
手机支付时,SM4 把金额、账号搅成乱码传输,黑客截到也只能干瞪眼。
刷身份证时,SM2 给身份信息盖了个电子防伪章,系统一验便知真假,冒牌货秒露馅。
电子病历流转时,SM3 算出唯一指纹,谁偷偷改了一个诊断结论,系统立刻报警。
连Wi-Fi时,新国标 WAPI 协议用 SM4 建了一条加密隧道,邻居蹭到信号也看不懂你在干嘛。
为什么非要自己的密码体系?
2013 年斯诺登曝光的"棱镜计划"给了全世界一记警钟:美国 NSA 曾在多个国际加密标准中埋后门。这就像你家装了进口智能锁,厂家手里却攥着一把万能钥匙。 一个 14 亿人的国家,金融、电力、通信、政务如果全靠别人的加密技术,风险可想而知。
国密的意义,就是把信息安全的主导权,实实在在地握在自己手里。
国密到底牛在哪?
更安全:SM2 基于椭圆曲线密码学,256 位的安全性相当于 3072 位的RSA,而密钥更短意味着手机运算更快、更省电。
更高效:SM3 的哈希速度比国际主流的 SHA-256 快约 30% ,处理海量数据时优势明显。
自主可控:从数学原理到代码实现全是自己人搞的,每一行逻辑都经得起审查,没有后门。
走向世界:2018 年,SM2/SM3/SM9 正式成为 ISO 国际标准,中国密码技术获得了全球认可。
Easysearch:给搜索引擎也装上"中国锁"
说到这儿你可能要问:国密算法除了在支付、身份证里用,企业后台系统能用吗?
当然能。现在很多国产基础软件已经把国密原生集成进去了,比如国产分布式搜索引擎 Easysearch。
Easysearch 是国产自研的搜索型数据库,主要干数据分析、全文检索、数据洞察的活儿,在不少政企系统里担任"数据管家"。它最大的亮点之一,就是天生带着国密基因。
Easysearch 基于铜锁(Tongsuo)实现了完整的国密 TLS 能力:SM2 为集群节点签发"国密身份证",防止冒名顶替;SM3 负责哈希摘要与签名校验,防篡改、防抵赖;SM4 将节点间通信与 HTTPS 传输全部加密,链路全程国密护航。
更重要的是,Easysearch 兼容 Elasticsearch 的 API,企业原来跑在国外搜索引擎上的业务,可以较低成本切过来,换个国产发动机,锁换成中国锁,车还能照开。这对政务、金融、能源等强监管行业来说,意味着能同时满足信创验收和等保合规的双重要求。
国密离你有多近?
比你以为的要近得多:新发的银行卡芯片、二代/三代身份证、各地的"一网通办"、"粤省事、""浙里办"、国产手机的支付模块、智能网联汽车的通信模块……甚至你查社保时后台跑着的搜索引擎,很可能都已经用上了国密算法。
下次刷身份证、扫码付款、登录政务 App 的时候,不妨想一想:在你看不见的地方,一串中国自主研发的算法正在默默守护着你的隐私。
写在最后
密码技术听起来硬核,但它守护的东西其实很柔软——是你的钱、你的隐私、你的身份,是一个国家数字社会的安全底座。从手机支付里的 SM4,到政务系统里的 SM2 签名,再到 Easysearch 这类国产基础软件的国密原生集成,国密算法的普及不是一句口号,而是像空气一样,无声地渗透进我们生活的每个角落。
下次有人问你"国密是什么",你可以这样回答:
"就是咱们中国自己造的'锁',专门给数字时代的宝贝上锁。现在,连搜索引擎都用上了这把'中国锁'。"
相关阅读
信创生态再扩容|极限科技 Easysearch、Coco AI 等产品与超聚变 FusionOS 26 完成双架构兼容性认证
资讯动态 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11332 次浏览 • 2026-08-26 19:17

近日,极限数据(北京)科技有限公司(简称:极限科技)与超聚变数字技术股份有限公司(简称:超聚变)完成产品兼容性互认证。极限科技旗下 INFINI Easysearch 搜索引擎软件、INFINI Gateway 极限网关软件、INFINI Console 极限控制台管理系统、Coco AI 智能搜索软件,与超聚变服务器操作系统 FusionOS 26,基于 X86、ARM 双架构完成严格的兼容性测试验证,并形成双方盖章确认的技术认证。

本次认证经过双方联合严格测试,验证结果显示,极限科技四款产品在 FusionOS 26 操作系统环境下功能运行正常、性能表现稳定,可完美适配 X86、ARM 主流国产化硬件架构,能够满足政企、金融、能源、政务等多行业场景下,海量数据检索、数据网关调度、集群运维管理、AI 智能检索等业务落地需求。
作为国产分布式搜索与智能检索领域核心厂商,极限科技打造的 INFINI 系列产品与 Coco AI,是面向海量数据场景的国产化基础软件,可作为 Elasticsearch 的国产化替代方案,广泛应用于日志检索、业务搜索、数据中台、智能问答等场景。超聚变 FusionOS 26 是面向服务器场景的国产企业级操作系统,支持多架构算力,具备高可靠、高性能、安全可信的特性,是信创基础设施中的核心底座之一。
此次全系列产品与超聚变 FusionOS 26 完成双架构适配认证,标志着极限科技产品在国产算力底座上的适配能力进一步完善,丰富了信创软硬件生态组合方案。后续双方将持续深化技术协同与生态合作,联合打造稳定成熟的国产化数据检索与智能应用解决方案,助力各行业数字化、信创化转型落地。
从国产替代到自主创新:极限科技亮相 DTCC 2026,分享 Easysearch 信创实践
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11196 次浏览 • 2026-08-26 16:27
8月20–22日,第17届中国数据库技术大会(DTCC 2026)在北京朗丽兹西山花园酒店举行。本届大会由 IT168 联合 ITPUB 主办,以“融数聚智 创领未来”为主题,汇聚众多数据库领域专家、技术从业者与企业代表,围绕数据库内核、云原生、AI、向量数据库、实时数仓、分布式数据库及行业实践等热点展开深入交流。
在8月21日下午的【向量数据库技术实践】专场,极限科技 CEO 曾勇带来主题分享《从国产替代到自主创新:Easysearch 在搜索引擎领域的信创实践》,从 AI 时代搜索引擎的新定位出发,系统分享搜索引擎国产化面临的关键挑战,以及 Easysearch 在兼容迁移、企业级能力、信创适配、安全容灾和 AI 搜索等方面的实践探索。

一、AI 时代,搜索引擎正在从“工具”走向“基础设施”
过去,搜索引擎主要承担“找到信息”的任务,以关键词匹配、倒排索引、全文检索和 BM25 等技术为核心,服务于企业文档搜索、网站搜索、日志检索和数据查询等场景。
而随着大模型、RAG 和 Agent 快速发展,搜索正在发生新的变化。
从“匹配字面”走向“理解语义”,从“返回结果”走向“辅助决策”,搜索引擎正在成为连接企业数据与 AI 能力的重要基础设施。

在曾勇的分享中,他将这一变化概括为:
从“找信息”走向“用知识”。
如今,企业知识库、智能客服、运维诊断助手、合规审查,以及多模态搜索、Agent 自主搜索等应用,都离不开高质量的检索能力。搜索引擎也因此成为 RAG 和 Agent 获取知识、理解上下文的重要底座。
这也意味着,搜索引擎一旦从普通工具升级为企业 AI 基础设施,其稳定性、安全性以及自主可控能力的重要性将进一步提升。
二、国产替代,不能只是“换一个引擎”
随着信创建设持续深入,国产化正在从基础设施和外围系统逐步进入核心业务与数据基础设施领域。
在曾勇看来,搜索引擎国产化并不是简单完成一次产品替换,而是一项涉及业务连续性、数据迁移、技术自主、安全合规和长期演进能力的系统工程。

因此,在进行搜索引擎国产化选型时,至少需要重点关注五个方面:
- 自主可控:核心引擎和关键技术是否真正掌握在自己手中;
- 企业级稳定性:能否支撑 TB/PB 级数据、高并发和 7×24 小时稳定运行;
- 信创真实适配:能否真正适配国产 CPU、操作系统等基础环境;
- 安全治理能力:权限、审计、加密、脱敏等能力是否能够内建;
- 长期演进能力:能否持续支撑向量检索、AI 搜索、多模态搜索等未来需求。
归根结底,企业选择的并不仅仅是一套搜索软件,而是未来数年持续承载企业数据和 AI 应用的技术底座。
三、从“敢替”到“好用”,Easysearch 持续构建企业级搜索底座
围绕企业国产化过程中最关心的“怎么替、怎么迁、怎么回退、谁来服务、如何运维”等问题,极限科技持续围绕 Easysearch 完善从搜索引擎内核到企业级平台的完整能力体系。
作为企业级分布式搜索型数据库,Easysearch 支持非结构化数据检索、全文检索、向量检索、地理位置查询、组合索引查询、多语种搜索和聚合分析,并提供企业级安全与管理能力。

1. 兼容生态,让迁移更平滑
对于已经大规模使用 Elasticsearch 的企业而言,迁移成本往往是国产替代过程中最现实的问题之一。
针对这一挑战,Easysearch 持续强化兼容能力,覆盖 REST API、Java/Python/Go/Node.js SDK、Query DSL,以及 ES 6.x/7.x/8.x 数据读写,并兼容 Kibana、Logstash、Beats、Filebeat 等常见生态工具。同时针对龙芯、鲲鹏、飞腾以及麒麟、统信 UOS 等国产软硬件环境开展适配。
这意味着企业在推进国产化时,可以尽可能复用现有应用、技术栈和运维经验,降低迁移改造成本。
2. 企业级能力,让国产搜索真正“好用”
国产化的终点并不是“能够运行”,而是能够真正支撑企业核心生产业务。
Easysearch 从内核层面持续补齐企业级能力,包括 TLS 加密、RBAC/ABAC 权限控制、字段级脱敏、LDAP/AD 认证、IP 黑白名单、防暴力破解、磁盘及快照加密、限流限速、审计日志、文档级权限以及国密算法等能力。
在安全与容灾方面,Easysearch 支持 SM2、SM3、SM4 国密算法,并提供全量/增量 Snapshot 备份、备份文件加密、跨集群复制以及跨机房部署等能力,为金融、政务等高安全、高可靠场景提供基础支撑。
四、从全文检索到向量检索,为 AI 应用打好搜索底座
AI 时代,搜索引擎需要解决的不再只是“关键词能不能搜到”,还需要理解数据背后的语义。
Easysearch 已将全文检索、向量检索与混合搜索能力统一在同一引擎中,支持 kNN 向量检索、HNSW/LSH 等向量索引方式,并支持 BM25 全文检索与向量相似度的双路召回和融合排序。

通过统一搜索引擎承载全文、向量和混合检索,可以减少企业额外部署独立向量数据库带来的架构复杂度与运维成本,并进一步支撑语义搜索、RAG、Agent 长期记忆、企业知识库和多模态检索等场景。
这也是 Easysearch 从传统搜索基础设施向 AI Search Infra 演进的重要一步。
五、立足自主研发,持续深耕搜索基础设施创新
本次 DTCC 2026 的技术分享,是极限科技对国产搜索信创实践的一次集中输出。未来,极限科技将继续坚持自主创新路线,以 Easysearch 为基础,进一步完善企业级搜索、向量检索、AI 搜索和自主可控能力,推动搜索基础设施从“国产替代”走向“自主创新”,为企业数智化与 AI 应用发展构建更加安全、稳定、开放、可持续的搜索技术底座。
CDC、查询卸载与 AI 检索:达梦 × Easysearch 技术交流干货回顾
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 9889 次浏览 • 2026-08-14 11:14
在金融行业数字化转型与信创建设持续推进的背景下,如何让国产数据库更好地支撑海量数据检索、实时分析与智能应用,成为越来越多企业关注的话题。
8 月 7 日,围绕 “达梦数据库 × Easysearch 金融行业搜索与分析加速方案”,我们开展了一场技术主题分享与交流活动。 由 极限科技技术专家杨帆 从金融行业实际业务需求出发,深入介绍了达梦数据库与 Easysearch 的协同架构,并围绕数据同步、查询卸载、性能优化以及国产化生态合作等问题,与参会伙伴展开了深入交流。

本次分享的核心方案,是通过 “达梦数据库 + CDC 实时同步 + Easysearch” 构建事务与检索分析分离的架构:达梦继续承担核心事务处理和主数据管理,Easysearch 则承接全文搜索、海量数据检索、多维分析以及 AI 检索等场景,让两套系统各司其职,共同提升数据服务能力。
一、为什么需要“数据库 + 搜索引擎”?
传统关系型数据库在 OLTP 场景下具有强一致性、事务处理和数据管理等优势,但当业务逐渐面临海量数据全文检索、多维聚合分析以及复杂搜索体验等需求时,单纯依赖数据库往往会面临新的挑战。

例如在金融场景中,交易明细、合同与制度文件、客户信息、日志数据等都需要被快速检索;与此同时,大量报表、聚合分析和历史数据查询又可能与核心交易业务争抢 CPU、IO 等资源。
分享中提到,达梦擅长 OLTP 事务处理、强一致性、数据安全与审计等能力,而在全文检索、相关性排序以及海量检索分析等方面,则可以通过 Easysearch 进行能力补充。
因此,方案的核心思路并不是简单地“用 Easysearch 替换数据库”,而是:
让数据库专注事务,让搜索引擎专注搜索与分析。
达梦负责写入、更新、事务一致性以及主数据管理;Easysearch 则负责从海量数据中快速“找出来、关联起来”,承接搜索、聚合、向量检索及 AI 等查询型负载。
二、CDC:连接事务库与检索分析库的关键纽带
在这样的架构中,如何让达梦中的数据及时同步到 Easysearch,是大家非常关注的问题。

本次方案采用 CDC 实时同步 的方式,整体链路包括三个阶段:
全量同步 → 增量同步 → 持续运行
首先将达梦存量数据同步至 Easysearch,建立数据基线;随后通过 CDC 持续捕获 INSERT、UPDATE、DELETE 等数据变化,并实时同步到 Easysearch,最终形成持续运行的数据同步链路。
在分享介绍的测试验证中,达梦 DM8 × Easysearch 已完成兼容认证测试,全量同步和增量同步均验证通过;在 CDC 高压同步测试中,万级变更可在 30 秒内完成同步,并实现读写一致、无积压。
三、现场技术交流:从“方案介绍”走向“实际问题”
相比单向的技术分享,本次活动更加精彩的部分,是分享结束后的互动交流。
围绕方案在真实生产环境中的落地,参会伙伴提出了多个非常有针对性的问题,分享老师也结合方案设计和实际经验进行了逐一解答。
1. CDC 延迟一般是多少?
CDC 是整个架构实现近实时数据同步的关键,因此大家首先关注了:
从达梦发生数据变更,到 Easysearch 可以查询到数据,中间通常存在多大的延迟?
这个问题实际上不仅涉及 CDC 本身,还与源端产生变更的速度、网络、同步任务处理能力以及目标端写入性能等多个因素相关。

在常规业务负载下,CDC 增量同步延迟可控制在秒级;如果业务变更量更高,可通过 Easysearch 动态扩容分片、增加 CDC 同步并发等方式进一步降低延迟,满足金融级近实时数据一致性要求。
2. 哪些查询适合留在达梦?哪些查询适合放到 Easysearch?
这是现场非常有代表性的一个问题。
实际上,“哪些数据进入 Easysearch”并不是简单按照表来划分,而更应该按照 业务访问模式和查询类型 来判断。
例如:
- 强事务、强一致性的核心业务操作,继续留在达梦;
- 精确查询、事务处理以及主数据维护,继续由达梦负责;
- 全文搜索、模糊查询、相关性排序等场景,可以交给 Easysearch;
- 海量数据检索、多维聚合分析、历史数据查询等,可以通过 Easysearch 进行查询卸载;
- 面向 AI 的向量检索、混合检索和 RAG 等场景,则可以进一步利用 Easysearch 的搜索能力。
这种“按负载类型进行职责分工”的方式,也是整个方案设计的核心。

3. 从搜索到分析:Easysearch 还能解决什么?
除了传统的全文检索,本次分享还介绍了 Easysearch 在海量数据分析、向量检索以及 AI 场景中的应用。

在全文搜索方面,Easysearch 支持 IK、拼音、HanLP 等中文分词能力,并提供 BM25 相关性评分、Function Score、高亮、同义词、搜索建议等能力。
在海量数据分析方面,则可以通过倒排索引、列式 Doc Values 以及聚合能力,承接交易明细分析、日志检索、客户行为分析以及风控等场景。
而在 AI 场景中,Easysearch 还可以进一步提供向量检索和全文检索融合能力,为 RAG、语义搜索、智能客服、推荐以及反欺诈等应用提供检索底座。
这意味着,数据库中的结构化数据经过同步之后,并不只是多了一个“搜索入口”,而是可以进一步形成 搜索、分析与 AI 多种数据服务能力。
4. 在国产数据库信创领域,达梦与 Easysearch 有哪些合作空间?
二者都是信创全栈适配的国产自主产品,合作空间非常广阔:
首先是联合解决方案落地:面向金融、运营商、政企等行业,提供“事务库 + 检索分析库”的信创标准架构,满足等保、密评要求,规避开源组件协议风险;
其次是国产化替代场景:Easysearch 可作为 Elasticsearch 的平滑替代产品,与达梦组合形成“去 IOE + 去开源 Elastic ”的全栈信创方案,目前已在中国移动、中国一汽等标杆项目中验证;

此外还有AI场景拓展:二者结合可支撑金融 RAG 知识库、智能风控、语义合规审查等 AI 应用,为信创环境下的智能化转型提供底座。
四、一次分享,也是一次技术碰撞
从达梦数据库到 Easysearch,从 CDC 到查询卸载,再到全文搜索、海量分析和 AI 检索,本次交流虽然围绕的是一个具体的技术方案,但大家讨论的其实是一个更加普遍的问题:
在信创和数字化转型背景下,如何让不同类型的数据基础设施发挥各自的优势,并最终服务于业务?
达梦与 Easysearch 的组合,并不是简单的“1+1”,而是通过职责分离,让事务处理、数据管理、搜索、分析和 AI 各自发挥所长。
技术分享有终点,技术交流没有终点。
感谢分享嘉宾的精彩内容,也感谢每一位参会伙伴的积极参与和深度交流。
期待下一次,我们继续围绕 搜索、数据库、数据分析、AI 与信创技术,碰撞出更多新的思路与实践。
达梦 × Easysearch,探索国产数据基础设施协同的新可能。
参考资源:
- PPT 下载:https://searchkit.cn/slides/347
- 达梦官网:https://dameng.com
- Easysearch 官网:https://easysearch.cn
INFINI Easysearch 向量搜索实战(二)
向量搜索 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 10064 次浏览 • 2026-08-09 12:39

上回 我们通过 Ingest Pipeline 把数据在写入 Easysearch 的过程中自动转换成了向量,这次我们通过 Search Pipeline 实现查询时将查询内容转换成向量并进行查询。
Embedding 服务
这里要保持与写入时使用的模型一致。
实战
我们实战演示分为以下几个步骤:
- 建立 Search Pipeline
- 设置索引默认 Pipeline
- 数据查询
建立 Search Pipeline
PUT /_search/pipeline/default_model_pipeline
{
"rewrite_processors": [
{
"semantic_query_enricher" : {
"description": "Sets the default embedding model",
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "<api_key>",
"default_model_id": "text-embedding-v4",
"vector_field_model_id": {
"text_vector": "text-embedding-v4"
}
}
}
]
}

设置索引默认 Pipeline
为了方便查询,不用每次查询都指定 Pipeline,我们设置默认值。
PUT /my-index/_settings
{
"index.search.default_pipeline" : "default_model_pipeline"
}

数据查询
使用上次写入的数据进行查询测试,但不直接查询原来的文本内容。
GET /my-index/_search
{
"_source": "input_text",
"query": {
"semantic": {
"text_vector": {
"query_text": "非常先进高级的生产车间",
"candidates": 100,
"query_strategy": "LSH_COSINE"
}
}
}
}
参数解释请查看文档。

OK,从上面可以看到,我们没有直接搜索原文本中的内容或关键字,但还是通过文本的语义检索到了相关内容。

关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。
相关文章:
INFINI Easysearch 向量搜索实战(一)
向量搜索 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 9504 次浏览 • 2026-08-09 12:35

Easysearch 提供了强大的向量搜索能力,打破传统关键词匹配的局限,实现真正的“懂你”的语义搜索。助力企业快速构建智能推荐、图像识别和内容理解等 AI 应用,释放数据深层价值。
核心能力
| 能力 | 说明 |
|---|---|
| 两种向量类型 | 稠密浮点向量(knn_dense_float_vector)和稀疏布尔向量(knn_sparse_bool_vector) |
| 多种索引模型 | lsh(局部敏感哈希,近似搜索)、permutation_lsh(置换 LSH)、sparse_indexed(倒排索引)、exact(精确搜索) |
| 多种相似度 | cosine(余弦)、l1(曼哈顿距离)、l2(欧氏距离)、jaccard、hamming |
| 与全文搜索融合 | 向量字段与文本字段存储在同一索引,支持 Hybrid 混合检索 |
| function_score 集成 | 向量相似度可作为 function_score 的评分函数 |
典型应用场景
- 语义搜索:文本通过 Embedding 模型转为向量,按语义相似度检索
- RAG 检索增强生成:为大语言模型提供知识库检索能力
- 推荐系统:用户/商品特征向量的相似推荐
- 图像/多模态搜索:图像特征向量的相似检索
- 去重与异常检测:通过向量距离判断内容相似度
Embedding 服务
在使用向量搜索前,先要准备一个 Embedding 模型,支持与 OpenAI API 兼容的 embedding 接口和 Ollama embedding 接口。本文使用阿里云上的 Embedding 模型进行演示。
写入方法
方法一:写入链路嵌入(推荐)
在数据写入 Easysearch 时,通过 Ingest Pipeline 自动调用 Embedding 服务:
应用写数据 → Easysearch → Ingest Pipeline → 调用 Embedding API → 写入向量字段
优势是写入后即可搜索,无需维护外部向量化流程。需要确保集群应至少有一个节点拥有 ingest 角色。
方法二:离线批处理
在应用侧完成向量化,再将向量字段直接写入 Easysearch:
原始数据 → 应用 → 调用模型 Embedding API → 写入 Easysearch(含向量字段)
参考文档。
实战
我们实战演示模式一,分为以下几个步骤:
- 建立带有向量字段的索引
- 创建对应的 Ingest Pipeline
- 写入数据到索引
1. 建立带有向量字段的索引
先建立一个带向量字段的索引,注意 dims 要与向量模型的输出匹配。
PUT /my-index
{
"mappings": {
"properties": {
"text_vector": {
"type": "knn_dense_float_vector",
"knn": {
"dims": 1024,
"model": "lsh",
"similarity": "cosine",
"L": 99,
"k": 1
}
}
}
}
}
2. 创建对应的 Ingest Pipeline
写入数据前先建立 Ingest Pipeline,注意 vendor 必须根据使用的模型来指定,比如本文使用的是阿里云 text-embedding-v4 模型,该模型提供了 OpenAI 格式的 API 接口,这里 vendor 我们就写 openai。
PUT _ingest/pipeline/text-embedding-pipeline
{
"description": "用于生成文本嵌入向量的管道",
"processors": [
{
"text_embedding": {
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "xxxxxx",
"text_field": "input_text",
"vector_field": "text_vector",
"model_id": "text-embedding-v4",
"dims": 1024,
"ignore_missing": false,
"ignore_failure": false
}
}
]
}
text_field:指定原始文本字段,Pipeline 会将该字段的内容转换成向量。
vector_field:指定向量存储的字段,保存上面转换的向量。
3. 写入数据
POST /_bulk?pipeline=text-embedding-pipeline&pretty
{"index": {"_index": "my-index", "_id": "1"}}
{"input_text": "苹果发布了新款iPhone 15 Pro手机,搭载A17芯片"}
{"index": {"_index": "my-index", "_id": "2"}}
{"input_text": "特斯拉宣布将在上海建第二座超级工厂"}
{"index": {"_index": "my-index", "_id": "3"}}
{"input_text": "今天天气真好,阳光明媚适合去公园散步"}
{"index": {"_index": "my-index", "_id": "4"}}
{"input_text": "程序员用Python写了一个自动化数据清洗脚本"}
{"index": {"_index": "my-index", "_id": "5"}}
{"input_text": "故宫博物院推出了夏季特展,展出珍贵文物"}
{"index": {"_index": "my-index", "_id": "6"}}
{"input_text": "小明每天坚持跑步五公里,身体越来越健康"}
{"index": {"_index": "my-index", "_id": "7"}}
{"input_text": "人工智能大模型在自然语言处理领域取得突破"}
{"index": {"_index": "my-index", "_id": "8"}}
{"input_text": "这家咖啡店的拿铁口感丝滑,推荐给咖啡爱好者"}
{"index": {"_index": "my-index", "_id": "9"}}
{"input_text": "量子计算机有望在药物研发中发挥重要作用"}
{"index": {"_index": "my-index", "_id": "10"}}
{"input_text": "周末和朋友一起去爬山,山顶的风景美极了"}

4. 检查数据
搜索索引数据,看看是否成功转换成了向量。可以看到原始数据保存在 input_text 字段中,其向量保存到了 text_vector。

OK,下一步我们看看怎么方便地实现向量搜索。

关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。
相关文章:
DBX:一款能连 Easysearch 的轻量开源桌面客户端来了
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11219 次浏览 • 2026-08-07 09:56
在 Windows、macOS、Linux 或 Docker 环境中,使用 DBX 一个轻量桌面客户端完成 Easysearch 连接管理、索引浏览、文档操作与查询。

一个界面管理 Easysearch
DBX 是一款开源、轻量的数据库工具,支持 70 多种数据库与数据服务。针对 Easysearch,DBX 提供以下常用能力:
- 保存并管理 Easysearch 连接,支持用户名、密码、TLS/SSL 与代理配置;
- 展开连接后直接浏览当前账号有权访问的索引;
- 以表格或文档视图查看、筛选、排序和分页浏览文档;
- 在查询编辑器中执行 REST、Query DSL 与常用 SQL;
- 对具备写入权限的索引新增、修改或删除文档;
- 通过 DBX MCP 将已有连接提供给支持 MCP 的 AI 工具使用。
三步连接 Easysearch
本文截图与示例基于 DBX v0.5.71 和 Easysearch v2.3.1。连接测试、集群状态查询、索引浏览、文档搜索与写入能力均已在实际环境中完成验证。
1. 选择 Easysearch
打开 DBX,点击顶部的“新建连接”。在数据库类型列表中搜索并选择 Easysearch,然后点击“下一步”。

2. 填写连接信息
填写连接名称、主机、端口、用户名和密码。Easysearch 常用 HTTP 端口为 9200;如果服务使用 HTTPS,请在“TLS/SSL”页签中配置证书校验方式。
也可以直接粘贴完整连接 URL,由 DBX 自动解析连接参数。发布或分享截图时,请始终隐藏真实密码、内部地址和访问令牌。

3. 测试并保存
点击“测试”确认网络、账号和权限配置正确,再点击“保存并连接”。连接成功后,DBX 会在左侧连接树中展示当前账号可访问的索引。
连接失败时优先检查
服务地址与端口是否可达;用户名、密码和账号权限是否正确;HTTPS 证书链与主机名校验是否匹配;本机代理、隧道或防火墙是否允许访问目标服务。
浏览索引与文档
展开 Easysearch 连接并点击索引,DBX 会读取索引结构并加载文档。常见字段可以直接以表格形式展示,也可以切换到文档视图查看完整 JSON。

工具栏提供刷新、自动刷新、跳转列、新增行、提交和回滚等操作。对于具备写入权限的索引,可以直接在结果区域新增或修改文档,再统一提交变更。
需要缩小结果范围时,可以在筛选区域输入 JSON 条件。例如筛选指定分类:
{
"category": "compatibility"
}
需要使用完整 Query DSL 时,可以通过 $esQuery 传入查询对象:
{
"$esQuery": {
"match": {
"title": "Easysearch"
}
}
}
执行 REST、Query DSL 与 SQL
DBX 的 Easysearch 查询编辑器支持 METHOD /path 格式的 REST 请求。输入请求后,使用编辑器左侧的执行按钮或快捷键运行,即可在下方查看状态码和 JSON 响应。
例如,检查集群健康状态:
GET /_cluster/health

更多查询方式
执行 Query DSL:
POST /products/_search
{
"query": {
"match": {
"name": "database"
}
}
}
对于 Easysearch 当前版本支持的常用 SQL,也可以直接输入:
SELECT title, category, score FROM products ORDER BY score DESC LIMIT 20;
DBX 会将兼容响应转换为结果表格。遇到 Elasticsearch 版本差异、专有扩展或 SQL 兼容性限制时,建议改用明确的 REST 与 Query DSL 请求,以便准确控制请求路径和参数。
与 AI 工具协作
启用 DBX MCP 后,支持 MCP 的 AI 编码工具可以复用 DBX 中保存的 Easysearch 连接,在现有访问策略下执行查询,无需在提示词或聊天记录中重复填写连接密码。
生产环境建议
为 AI 工具单独准备只读或受限账号,明确允许访问的索引范围,并保持文档写入、删除索引等高风险操作默认关闭。
下载与反馈
Easysearch 官网:https://easysearch.cn
DBX 官网:https://dbxio.com
DBX 下载:https://github.com/t8y2/dbx/releases
DBX GitHub:https://github.com/t8y2/dbx
如果你正在使用 Easysearch,可以下载 DBX 体验连接管理、索引浏览、文档操作和查询能力。遇到兼容性问题或有新的使用建议,欢迎在 DBX GitHub 仓库提交 Issue。
Easysearch 2.3.1 发布:强化集群运维能力,优化写入性能与稳定性体验
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 10120 次浏览 • 2026-08-06 18:23

INFINI Easysearch 2.3.1 正式发布。本版本围绕企业级搜索服务的运维管理、安全控制和性能优化持续演进,新增更全面的巡检信息采集能力,增强集群服务管理约束,优化文档写入与 mapping 解析性能,并针对 S3 兼容存储、CCR 恢复、UI 管理等场景修复多项问题,进一步提升系统稳定性、兼容性与生产环境使用体验。
Easysearch 本次更新如下:
功能特性 (Features)
- 巡检 UI 新增集群状态、模板、索引元数据、快照、集群运行时信息、节点信息、插件、节点诊断信息及分片/段信息等采集项,提升问题诊断覆盖范围。
- 服务管理 UI 的创建和加入集群流程新增节点角色约束,协调节点不能与 master、data、ingest 角色同时选择。
- 服务管理登录时增加 root 账户限制检测,避免以 root 账户访问受管服务。
改进优化 (Improvements)
- 新增 S3
disable_bulk_delete配置(客户端名称空间为s3.client.<name>.disable_bulk_delete,默认false);启用后批量删除路径会逐个调用DeleteObject,用于兼容不支持DeleteObjects的 S3 兼容存储。 - 持续完善
source_reuse的写入和读取重建,提升复杂 mapping 场景下的兼容性和性能;包含nestedmapping 的索引改用完整_source,已有索引动态加入nestedmapping 后需 reindex。 - 优化文档写入与 mapping 解析热路径,减少 JSON/XContent、日期和点号字段解析中的对象创建与重复处理,提升批量索引吞吐。
- 巡检任务默认不再勾选“数据样本”采集;需要时仍可手动启用,降低默认采集真实索引数据的风险。
问题修复(Bug Fixes)
- 修复开启安全认证且根路径不允许匿名访问时,Easysearch UI 因登录前探测根路径而无法登录的问题。
- 修复 Agent 服务管理中可通过服务列表或巡检入口绕过服务登录状态的问题。
- 修复编辑集群配置时可能意外重置管理员密码的问题。
- 修复巡检页面无法正确解析服务版本的问题。
- 修复开发工具中缓存的集群名称、标识与实际集群信息不同步的问题。
- 修复 Java 21 环境下 CCR 初始恢复并发读取文件时可能触发
IllegalStateException: confined并导致恢复失败的问题。
以上为本版本重点更新摘要,更多详情请查看 Easysearch 产品 Release Notes 或联系我们的技术支持团队!
获取新版本
INFINI Easysearch v2.3.1 已正式发布,欢迎升级体验:
- 下载地址:https://infinilabs.cn/download/
- 快速开始:https://docs.infinilabs.com/easysearch/main/docs/quick-start/
关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。

INFINI Easysearch 向量搜索实战(一)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 14021 次浏览 • 2026-07-18 19:38

Easysearch 提供了强大的向量搜索能力,打破传统关键词匹配的局限,实现真正的“懂你”的语义搜索。助力企业快速构建智能推荐、图像识别和内容理解等 AI 应用,释放数据深层价值。
核心能力
| 能力 | 说明 |
|---|---|
| 两种向量类型 | 稠密浮点向量(knn_dense_float_vector)和稀疏布尔向量(knn_sparse_bool_vector) |
| 多种索引模型 | lsh(局部敏感哈希,近似搜索)、permutation_lsh(置换 LSH)、sparse_indexed(倒排索引)、exact(精确搜索) |
| 多种相似度 | cosine(余弦)、l1(曼哈顿距离)、l2(欧氏距离)、jaccard、hamming |
| 与全文搜索融合 | 向量字段与文本字段存储在同一索引,支持 Hybrid 混合检索 |
| function_score 集成 | 向量相似度可作为 function_score 的评分函数 |
典型应用场景
- 语义搜索:文本通过 Embedding 模型转为向量,按语义相似度检索
- RAG 检索增强生成:为大语言模型提供知识库检索能力
- 推荐系统:用户/商品特征向量的相似推荐
- 图像/多模态搜索:图像特征向量的相似检索
- 去重与异常检测:通过向量距离判断内容相似度
Embedding 服务
在使用向量搜索前,先要准备一个 Embedding 模型,支持与 OpenAI API 兼容的 embedding 接口和 Ollama embedding 接口。本文使用阿里云上的 Embedding 模型进行演示。
写入方法
方法一:写入链路嵌入(推荐)
在数据写入 Easysearch 时,通过 Ingest Pipeline 自动调用 Embedding 服务:
应用写数据 → Easysearch → Ingest Pipeline → 调用 Embedding API → 写入向量字段
优势是写入后即可搜索,无需维护外部向量化流程。需要确保集群应至少有一个节点拥有 ingest 角色。
方法二:离线批处理
在应用侧完成向量化,再将向量字段直接写入 Easysearch:
原始数据 → 应用 → 调用模型 Embedding API → 写入 Easysearch(含向量字段)
参考文档。
实战
我们实战演示模式一,分为以下几个步骤:
- 建立带有向量字段的索引
- 创建对应的 Ingest Pipeline
- 写入数据到索引
1. 建立带有向量字段的索引
先建立一个带向量字段的索引,注意 dims 要与向量模型的输出匹配。
PUT /my-index
{
"mappings": {
"properties": {
"text_vector": {
"type": "knn_dense_float_vector",
"knn": {
"dims": 1024,
"model": "lsh",
"similarity": "cosine",
"L": 99,
"k": 1
}
}
}
}
}
2. 创建对应的 Ingest Pipeline
写入数据前先建立 Ingest Pipeline,注意 vendor 必须根据使用的模型来指定,比如本文使用的是阿里云 text-embedding-v4 模型,该模型提供了 OpenAI 格式的 API 接口,这里 vendor 我们就写 openai。
PUT _ingest/pipeline/text-embedding-pipeline
{
"description": "用于生成文本嵌入向量的管道",
"processors": [
{
"text_embedding": {
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "xxxxxx",
"text_field": "input_text",
"vector_field": "text_vector",
"model_id": "text-embedding-v4",
"dims": 1024,
"ignore_missing": false,
"ignore_failure": false
}
}
]
}
text_field:指定原始文本字段,Pipeline 会将该字段的内容转换成向量。
vector_field:指定向量存储的字段,保存上面转换的向量。
3. 写入数据
POST /_bulk?pipeline=text-embedding-pipeline&pretty
{"index": {"_index": "my-index", "_id": "1"}}
{"input_text": "苹果发布了新款iPhone 15 Pro手机,搭载A17芯片"}
{"index": {"_index": "my-index", "_id": "2"}}
{"input_text": "特斯拉宣布将在上海建第二座超级工厂"}
{"index": {"_index": "my-index", "_id": "3"}}
{"input_text": "今天天气真好,阳光明媚适合去公园散步"}
{"index": {"_index": "my-index", "_id": "4"}}
{"input_text": "程序员用Python写了一个自动化数据清洗脚本"}
{"index": {"_index": "my-index", "_id": "5"}}
{"input_text": "故宫博物院推出了夏季特展,展出珍贵文物"}
{"index": {"_index": "my-index", "_id": "6"}}
{"input_text": "小明每天坚持跑步五公里,身体越来越健康"}
{"index": {"_index": "my-index", "_id": "7"}}
{"input_text": "人工智能大模型在自然语言处理领域取得突破"}
{"index": {"_index": "my-index", "_id": "8"}}
{"input_text": "这家咖啡店的拿铁口感丝滑,推荐给咖啡爱好者"}
{"index": {"_index": "my-index", "_id": "9"}}
{"input_text": "量子计算机有望在药物研发中发挥重要作用"}
{"index": {"_index": "my-index", "_id": "10"}}
{"input_text": "周末和朋友一起去爬山,山顶的风景美极了"}

4. 检查数据
搜索索引数据,看看是否成功转换成了向量。可以看到原始数据保存在 input_text 字段中,其向量保存到了 text_vector。

OK,下一步我们看看怎么方便地实现向量搜索。

关于 Easysearch

INFINI Easysearch 是一个分布式的搜索型数据库,实现非结构化数据检索、全文检索、向量检索、地理位置信息查询、组合索引查询、多语种支持、聚合分析等。Easysearch 可以完美替代 Elasticsearch,同时添加和完善多项企业级功能。Easysearch 助您拥有简洁、高效、易用的搜索体验。
官网文档:https://docs.infinilabs.com/easysearch
相关文章:
【 INFINI Workshop 北京站】1月18日一起动手实验玩转 Easysearch
活动 • liaosy 发表了文章 • 0 个评论 • 6665 次浏览 • 2023-12-15 16:22
与 INFINI Labs 的技术专家面对面,第一时间了解极限实验室的发布最新产品和功能特性,通过动手实战,快速掌握最前沿的搜索技术,并用于实际项目中。欢迎大家扫描海报二维码免费报名参加。
活动时间:2024-01-18 13:30~17:30
活动地点:北京市海淀区 Wework 辉煌时代大厦 3 楼 3E 会议室
分享议题
- Easysearch 总体介绍及搭建实战
- 基于 INFINI Console 实现跨版本、跨引擎统一管控
- Elasticsearch -> Easysearch 在线迁移实操
参会提示
- 请务必自备电脑(Windows 系统环境请提前安装好 Linux 虚拟机)
- 请提前在 INFINI Labs 官网下载对应平台最新安装包(INFINI Easysearch、INFINI Gateway、INFINI Console)
- 下载地址:https://www.infinilabs.com/download
- 如有任何疑问可添加 INFINI Labs 小助手(微信号: INFINI-Labs)进行联系
【INFINI Workshop 上海站】7 月 27 日一起动手实验玩转 Easysearch
资讯动态 • liaosy 发表了文章 • 1 个评论 • 4900 次浏览 • 2023-07-07 16:30
〖搜索客社区日报〗第2302期 (2026-09-21)
社区日报 • Muses 发表了文章 • 0 个评论 • 118 次浏览 • 13 小时前
Easysearch 原生集成国密算法:打造全链路自主可控搜索底座(二)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 1064 次浏览 • 2 天前

从 2.1.0 版本开始,INFINI Easysearch 内置了对国密(SM2/3/4)算法的支持,实现了全链路国密合规,满足等保及商用密码应用安全性评估要求。本篇以 Kylin-Server V11 操作系统和 Easysearch 2.3.0 进行演示。
Linux 主机安装 Tongsuo
Easysearch 基于 铜锁(Tongsuo)提供国密 TLCP 双证书能力,支持 SM2/SM3/SM4 加密套件。下载完 Easysearch 软件包后解压进目录,执行脚本安装铜锁。
bin/install-tongsuo-local.sh --version 8.4.0

安装完后会有提示切换到铜锁。

能正常查看版本信息,说明安装、切换都正常。

一键初始化(单节点 TLCP)
如需在单节点场景快速完成证书生成、TLCP 配置写入和初始密码设置,可直接使用:
EASYSEARCH_INITIAL_ADMIN_PASSWORD='EasysearchP@ssw0rd!' bin/initialize.sh --tlcp -s
执行上面的脚本会自动生成证书,修改 easysearch.yml 证书设置。



启动 Easysearch
从 Easysearch 的启动日志中可看到国密(Chinese SM algorithms)正常加载,并用来创建 SSLContext 。

客户端:用国密栈访问
curl 默认链接的 OpenSSL 密码库不支持国密协议(TLCP),因此 curl 访问 Easysearch 服务时加密协议最终回落到标准 TLS 1.3,套件为国际通用的 TLS_AES_128_GCM_SHA256。

用 Easysearch 发行包自带的 bin/tlcp-curl.sh 访问 Easysearch,可以看到加密套件是国密 TLS_SM4_GCM_SM3。

Java 应用默认使用的 OpenJDK 没有内置国密算法支持,所以不能直接走国密加密;要么换成支持国密的 JDK,要么在现有 JDK 中额外引入并注册国密算法实现。

相关阅读
Easysearch 2.4.0 发布:原生 HNSW 与混合检索,管理体验全面升级
资讯动态 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 1057 次浏览 • 2 天前

INFINI Easysearch 2.4.0 正式发布。本版本将向量搜索纳入内核:基于 Lucene 的原生 HNSW,关键词与语义向量可混合检索。控制台新增可视化 Mapping 编辑器,集群设置可同时查看临时、持久、默认三层配置。生命周期策略、可搜索快照、密钥库与插件管理同步更新,高并发下的字段使用统计和磁盘用量分析也更稳定。
主要更新如下:
功能特性 (Features)
原生 HNSW 向量搜索与混合检索
- 内置基于 Lucene 的 HNSW 向量索引。新建索引可直接使用
dense_vector、query-levelknn和顶层knn,无需安装 k-NN 插件。 - 支持 1~4096 维
float向量,以及cosine、dot_product、l2_norm、max_inner_product四种相似度算法。 - 支持通过
m、ef_construction和num_candidates调整索引构建与查询效果;省略index_options时默认使用hnsw(m=16, ef_construction=100)。 - 支持一个顶层关键词
query与一个顶层knn并列执行,通过结果并集与加权评分实现关键词、语义向量的混合召回。 - 兼容 Elasticsearch 8.19.17 的 float HNSW mapping、Bulk、kNN 查询和 wire 行为,以及 Elasticsearch Java 8.19.17、Python 8.19.3 官方客户端,现有应用可直接对接。
更多用法及兼容边界请参阅原生 HNSW 搜索文档。
可视化 Mapping 编辑器
新增索引页提供可视化 Mapping 编辑器。字段按层级排列成树,可直接编辑类型和参数,无需手写 Mapping JSON。

- 可以从索引模板或已有索引导入配置。创建索引时,也可以关联集群里已有的别名。
- 覆盖全部字段类型。支持多字段,也可为
object/nested添加子字段,同类型字段可批量添加。 - 可视化编辑与 JSON 编辑可随时切换,内容保持同步。
dynamic_templates、_source、_meta等高级内容在切换后仍会保留。
操作步骤见新增索引。
集群设置页
在「设置」中打开集群设置页,查看和修改 _cluster/settings 中的动态配置。页面按节点、索引、分片、断路器、生命周期分组,支持按名称或 key 搜索,也可按临时、持久、默认来源过滤。

- 每个设置有三层值:临时、持久、默认。优先级是临时 > 持久 > 默认。徽标标出当前生效的那一层。
- 布尔和枚举使用下拉框,数字使用数字输入,时间、大小等带单位的值直接填写,例如
60s、40mb。临时层与持久层可一次保存。支持清除单层,也可一键清空全部临时设置。 - 日志级别、分片分配属性、断路器等名称不固定的设置,可先添加实例,再填写取值。

操作步骤见集群设置。
数据管理与分析体验
- 数据探索改用 PIT(Point in Time)分页导出,导出数量不再受
max_result_window限制。 - 生命周期策略编辑器可配置的 action 更多,未填写的字段保持原有语义。
- 快照恢复支持直接恢复为可搜索快照,索引列表增加可搜索快照标识。
- 节点页面新增密钥库管理,插件列表支持从文件夹或 ZIP 包手动上传插件。这两项需先在右上角连接 Agent 后使用。
- 创建 API Token 或角色时,索引权限支持下拉选择和搜索。
rate聚合新增sum、value_count计算模式,并支持在包含单一日期源的composite聚合中计算速率。- DevTools 现支持 SQL 关键词高亮、补全和多行语句解析,查询结果默认返回 CSV。
- 生命周期(ILM)策略管理: 对生命周期策略编辑 UI 进行了全面增强,新建与编辑策略现已支持完整的 action 配置,覆盖 Hot、Warm、Cold、Delete 四个阶段
改进优化 (Improvements)
- 重构
_disk_usage同步分析链路,引入有界请求调度和独立线程池,降低并发磁盘用量分析对普通分析请求的影响。 - 重构
_field_usage_stats的 shard 级字段访问采集链路,按每次查询会话对相同字段和访问类型去重,完善 stored fields、term vectors、can-match、refresh/reopen 及主副分片场景的统计覆盖。 - 优化字段使用统计在高并发查询和大字段 registry 场景下的会话提交与快照生成,减少处理开销和临时对象分配。
问题修复 (Bug Fixes)
- 统一重构 Model Provider、Rules 与 Audit Log 的受保护内部索引权限过滤机制,修复直连、通配符、混合索引及数据流后备索引等场景下过滤语义不一致的问题;无权限用户直接访问受保护资源时会被拒绝,在混合或通配符请求中则隐藏相关资源,同时保留远程索引表达式和 Audit Log 的角色授权语义。
- 修复 Remote Reindex 对远端 Elasticsearch REST 协议版本判断不准确的问题,恢复 Elasticsearch 6.8.x、7.x 和 8.x 场景下 scroll 与 clear-scroll 请求的正确格式。
- 修复删除关联多个索引的别名失败的问题。
- 修复授权弹窗打开后「授权提示」页签可能自动消失的问题。
- 修复未授权状态显示为不规范英文的问题,现按界面语言显示「未授权 / Unlicensed」。
- 修复创建用户、角色、管道、模板、远程集群、快照仓库、自动跟随模式、规则库时重名可能覆盖已有配置的问题,现在会提示名称已存在。
- 修复编辑管道时可修改名称导致旧管道残留的问题,编辑时名称改为不可修改。
- 修复删除管道确认弹窗文案误写为「模板」的问题。
- 修复列表页左侧聚合过滤侧边栏输入关键字后无法筛选的问题。
- 修复分片列表点击刷新不重新加载数据的问题。
- 修复热点线程页面选择不支持的 gpu/mem 类型后列表为空且无提示的问题,下拉现仅提供受支持的类型。
- 修复创建角色无法选择粗粒度 action group,以及集群权限与索引权限被强制必填的问题。
- 修复数据探索导出超过 10000 条文档失败的问题。
- 移除生命周期策略编辑器中错误的节点标签缺失实时提醒。
- 修复节点详情插件页显示集群级安装状态的问题:插件只装在部分节点时,未安装的节点也会显示「已安装」;现在按当前节点过滤。
- 修复删除生命周期策略时确认弹窗不显示策略名的问题。
- 修复删除快照确认弹窗误用「策略」且不显示快照名的问题。
- 修复创建生命周期策略时前端重名校验不生效的问题。
升级提示
- 原生 HNSW 的已索引
dense_vector字段只能添加到由 2.4.0 或更高版本创建的索引,且所有数据节点均需升级到 2.4.0 或更高版本;旧索引需新建目标索引后通过 Reindex 迁移。 - 旧 k-NN 插件的
knn_dense_float_vector、knn_sparse_bool_vector和knn_nearest_neighbors接口继续保留,但新旧字段与查询语法不能混用。 - Easysearch 2.4.0 使用未量化的 float HNSW,当前不支持
int8_hnsw等量化向量类型。通过 Elasticsearch 8.19 官方客户端访问时,需在所有节点设置elasticsearch.api_compatibility: true和elasticsearch.api_compatibility_version: "8.19.17",并重启节点。
以上为本版本重点更新摘要,完整变更与技术细节请查看 Easysearch 产品 Release Notes 或联系我们的技术支持团队
获取新版本
INFINI Easysearch v2.4.0 已正式发布,欢迎升级体验:
- 下载地址:https://infinilabs.cn/download/
- 快速开始:https://docs.infinilabs.com/easysearch/main/docs/quick-start/
关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。

【搜索客社区日报】第2274期 (2026-07-27)
社区日报 • Muses 发表了文章 • 0 个评论 • 2565 次浏览 • 5 天前
【搜索客社区日报】第2298期 (2026-09-14)
社区日报 • Muses 发表了文章 • 0 个评论 • 4412 次浏览 • 2026-09-14 07:37
【搜索客社区日报】第2296期 (2026-09-07)
社区日报 • Muses 发表了文章 • 0 个评论 • 7488 次浏览 • 2026-09-07 14:40
Easysearch 原生集成国密算法:打造全链路自主可控搜索底座(一)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11684 次浏览 • 2026-08-28 19:51

国密算法:藏在手机里的"中国锁"
你有没有想过,每次扫码付款、刷身份证进站、在政务 App 上查社保时,是谁在背后保护你的信息安全?
答案可能比你想象得更"国产"——它叫国密算法。你可以把它理解成一套完全国产自研的"数字锁"。
什么是国密?
"国密"是国家商用密码的简称,由国家密码管理局制定管理。
打个比方:以前咱家装锁,大多是国外品牌,钥匙齿形设计也是人家的专利。万一厂家留了后门,你家大门就等于敞开了。国密算法干的活儿,就是给整个数字社会换上一把完全国产、自主可控的"中国锁"。
这个"锁具家族"成员不少:
SM2:负责数字签名,相当于给数据盖防伪章;
SM3:负责生成"数字指纹",谁改了一个字都能被发现;
SM4:负责把数据搅成乱码,只有对的人才能还原;
SM9:更神奇,直接用手机号或邮箱就能加密。
注:SM = "商密"拼音首字母,不是什么神秘代号 😄
国密到底保护了什么?
手机支付时,SM4 把金额、账号搅成乱码传输,黑客截到也只能干瞪眼。
刷身份证时,SM2 给身份信息盖了个电子防伪章,系统一验便知真假,冒牌货秒露馅。
电子病历流转时,SM3 算出唯一指纹,谁偷偷改了一个诊断结论,系统立刻报警。
连Wi-Fi时,新国标 WAPI 协议用 SM4 建了一条加密隧道,邻居蹭到信号也看不懂你在干嘛。
为什么非要自己的密码体系?
2013 年斯诺登曝光的"棱镜计划"给了全世界一记警钟:美国 NSA 曾在多个国际加密标准中埋后门。这就像你家装了进口智能锁,厂家手里却攥着一把万能钥匙。 一个 14 亿人的国家,金融、电力、通信、政务如果全靠别人的加密技术,风险可想而知。
国密的意义,就是把信息安全的主导权,实实在在地握在自己手里。
国密到底牛在哪?
更安全:SM2 基于椭圆曲线密码学,256 位的安全性相当于 3072 位的RSA,而密钥更短意味着手机运算更快、更省电。
更高效:SM3 的哈希速度比国际主流的 SHA-256 快约 30% ,处理海量数据时优势明显。
自主可控:从数学原理到代码实现全是自己人搞的,每一行逻辑都经得起审查,没有后门。
走向世界:2018 年,SM2/SM3/SM9 正式成为 ISO 国际标准,中国密码技术获得了全球认可。
Easysearch:给搜索引擎也装上"中国锁"
说到这儿你可能要问:国密算法除了在支付、身份证里用,企业后台系统能用吗?
当然能。现在很多国产基础软件已经把国密原生集成进去了,比如国产分布式搜索引擎 Easysearch。
Easysearch 是国产自研的搜索型数据库,主要干数据分析、全文检索、数据洞察的活儿,在不少政企系统里担任"数据管家"。它最大的亮点之一,就是天生带着国密基因。
Easysearch 基于铜锁(Tongsuo)实现了完整的国密 TLS 能力:SM2 为集群节点签发"国密身份证",防止冒名顶替;SM3 负责哈希摘要与签名校验,防篡改、防抵赖;SM4 将节点间通信与 HTTPS 传输全部加密,链路全程国密护航。
更重要的是,Easysearch 兼容 Elasticsearch 的 API,企业原来跑在国外搜索引擎上的业务,可以较低成本切过来,换个国产发动机,锁换成中国锁,车还能照开。这对政务、金融、能源等强监管行业来说,意味着能同时满足信创验收和等保合规的双重要求。
国密离你有多近?
比你以为的要近得多:新发的银行卡芯片、二代/三代身份证、各地的"一网通办"、"粤省事、""浙里办"、国产手机的支付模块、智能网联汽车的通信模块……甚至你查社保时后台跑着的搜索引擎,很可能都已经用上了国密算法。
下次刷身份证、扫码付款、登录政务 App 的时候,不妨想一想:在你看不见的地方,一串中国自主研发的算法正在默默守护着你的隐私。
写在最后
密码技术听起来硬核,但它守护的东西其实很柔软——是你的钱、你的隐私、你的身份,是一个国家数字社会的安全底座。从手机支付里的 SM4,到政务系统里的 SM2 签名,再到 Easysearch 这类国产基础软件的国密原生集成,国密算法的普及不是一句口号,而是像空气一样,无声地渗透进我们生活的每个角落。
下次有人问你"国密是什么",你可以这样回答:
"就是咱们中国自己造的'锁',专门给数字时代的宝贝上锁。现在,连搜索引擎都用上了这把'中国锁'。"
相关阅读
信创生态再扩容|极限科技 Easysearch、Coco AI 等产品与超聚变 FusionOS 26 完成双架构兼容性认证
资讯动态 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11332 次浏览 • 2026-08-26 19:17

近日,极限数据(北京)科技有限公司(简称:极限科技)与超聚变数字技术股份有限公司(简称:超聚变)完成产品兼容性互认证。极限科技旗下 INFINI Easysearch 搜索引擎软件、INFINI Gateway 极限网关软件、INFINI Console 极限控制台管理系统、Coco AI 智能搜索软件,与超聚变服务器操作系统 FusionOS 26,基于 X86、ARM 双架构完成严格的兼容性测试验证,并形成双方盖章确认的技术认证。

本次认证经过双方联合严格测试,验证结果显示,极限科技四款产品在 FusionOS 26 操作系统环境下功能运行正常、性能表现稳定,可完美适配 X86、ARM 主流国产化硬件架构,能够满足政企、金融、能源、政务等多行业场景下,海量数据检索、数据网关调度、集群运维管理、AI 智能检索等业务落地需求。
作为国产分布式搜索与智能检索领域核心厂商,极限科技打造的 INFINI 系列产品与 Coco AI,是面向海量数据场景的国产化基础软件,可作为 Elasticsearch 的国产化替代方案,广泛应用于日志检索、业务搜索、数据中台、智能问答等场景。超聚变 FusionOS 26 是面向服务器场景的国产企业级操作系统,支持多架构算力,具备高可靠、高性能、安全可信的特性,是信创基础设施中的核心底座之一。
此次全系列产品与超聚变 FusionOS 26 完成双架构适配认证,标志着极限科技产品在国产算力底座上的适配能力进一步完善,丰富了信创软硬件生态组合方案。后续双方将持续深化技术协同与生态合作,联合打造稳定成熟的国产化数据检索与智能应用解决方案,助力各行业数字化、信创化转型落地。
从国产替代到自主创新:极限科技亮相 DTCC 2026,分享 Easysearch 信创实践
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11196 次浏览 • 2026-08-26 16:27
8月20–22日,第17届中国数据库技术大会(DTCC 2026)在北京朗丽兹西山花园酒店举行。本届大会由 IT168 联合 ITPUB 主办,以“融数聚智 创领未来”为主题,汇聚众多数据库领域专家、技术从业者与企业代表,围绕数据库内核、云原生、AI、向量数据库、实时数仓、分布式数据库及行业实践等热点展开深入交流。
在8月21日下午的【向量数据库技术实践】专场,极限科技 CEO 曾勇带来主题分享《从国产替代到自主创新:Easysearch 在搜索引擎领域的信创实践》,从 AI 时代搜索引擎的新定位出发,系统分享搜索引擎国产化面临的关键挑战,以及 Easysearch 在兼容迁移、企业级能力、信创适配、安全容灾和 AI 搜索等方面的实践探索。

一、AI 时代,搜索引擎正在从“工具”走向“基础设施”
过去,搜索引擎主要承担“找到信息”的任务,以关键词匹配、倒排索引、全文检索和 BM25 等技术为核心,服务于企业文档搜索、网站搜索、日志检索和数据查询等场景。
而随着大模型、RAG 和 Agent 快速发展,搜索正在发生新的变化。
从“匹配字面”走向“理解语义”,从“返回结果”走向“辅助决策”,搜索引擎正在成为连接企业数据与 AI 能力的重要基础设施。

在曾勇的分享中,他将这一变化概括为:
从“找信息”走向“用知识”。
如今,企业知识库、智能客服、运维诊断助手、合规审查,以及多模态搜索、Agent 自主搜索等应用,都离不开高质量的检索能力。搜索引擎也因此成为 RAG 和 Agent 获取知识、理解上下文的重要底座。
这也意味着,搜索引擎一旦从普通工具升级为企业 AI 基础设施,其稳定性、安全性以及自主可控能力的重要性将进一步提升。
二、国产替代,不能只是“换一个引擎”
随着信创建设持续深入,国产化正在从基础设施和外围系统逐步进入核心业务与数据基础设施领域。
在曾勇看来,搜索引擎国产化并不是简单完成一次产品替换,而是一项涉及业务连续性、数据迁移、技术自主、安全合规和长期演进能力的系统工程。

因此,在进行搜索引擎国产化选型时,至少需要重点关注五个方面:
- 自主可控:核心引擎和关键技术是否真正掌握在自己手中;
- 企业级稳定性:能否支撑 TB/PB 级数据、高并发和 7×24 小时稳定运行;
- 信创真实适配:能否真正适配国产 CPU、操作系统等基础环境;
- 安全治理能力:权限、审计、加密、脱敏等能力是否能够内建;
- 长期演进能力:能否持续支撑向量检索、AI 搜索、多模态搜索等未来需求。
归根结底,企业选择的并不仅仅是一套搜索软件,而是未来数年持续承载企业数据和 AI 应用的技术底座。
三、从“敢替”到“好用”,Easysearch 持续构建企业级搜索底座
围绕企业国产化过程中最关心的“怎么替、怎么迁、怎么回退、谁来服务、如何运维”等问题,极限科技持续围绕 Easysearch 完善从搜索引擎内核到企业级平台的完整能力体系。
作为企业级分布式搜索型数据库,Easysearch 支持非结构化数据检索、全文检索、向量检索、地理位置查询、组合索引查询、多语种搜索和聚合分析,并提供企业级安全与管理能力。

1. 兼容生态,让迁移更平滑
对于已经大规模使用 Elasticsearch 的企业而言,迁移成本往往是国产替代过程中最现实的问题之一。
针对这一挑战,Easysearch 持续强化兼容能力,覆盖 REST API、Java/Python/Go/Node.js SDK、Query DSL,以及 ES 6.x/7.x/8.x 数据读写,并兼容 Kibana、Logstash、Beats、Filebeat 等常见生态工具。同时针对龙芯、鲲鹏、飞腾以及麒麟、统信 UOS 等国产软硬件环境开展适配。
这意味着企业在推进国产化时,可以尽可能复用现有应用、技术栈和运维经验,降低迁移改造成本。
2. 企业级能力,让国产搜索真正“好用”
国产化的终点并不是“能够运行”,而是能够真正支撑企业核心生产业务。
Easysearch 从内核层面持续补齐企业级能力,包括 TLS 加密、RBAC/ABAC 权限控制、字段级脱敏、LDAP/AD 认证、IP 黑白名单、防暴力破解、磁盘及快照加密、限流限速、审计日志、文档级权限以及国密算法等能力。
在安全与容灾方面,Easysearch 支持 SM2、SM3、SM4 国密算法,并提供全量/增量 Snapshot 备份、备份文件加密、跨集群复制以及跨机房部署等能力,为金融、政务等高安全、高可靠场景提供基础支撑。
四、从全文检索到向量检索,为 AI 应用打好搜索底座
AI 时代,搜索引擎需要解决的不再只是“关键词能不能搜到”,还需要理解数据背后的语义。
Easysearch 已将全文检索、向量检索与混合搜索能力统一在同一引擎中,支持 kNN 向量检索、HNSW/LSH 等向量索引方式,并支持 BM25 全文检索与向量相似度的双路召回和融合排序。

通过统一搜索引擎承载全文、向量和混合检索,可以减少企业额外部署独立向量数据库带来的架构复杂度与运维成本,并进一步支撑语义搜索、RAG、Agent 长期记忆、企业知识库和多模态检索等场景。
这也是 Easysearch 从传统搜索基础设施向 AI Search Infra 演进的重要一步。
五、立足自主研发,持续深耕搜索基础设施创新
本次 DTCC 2026 的技术分享,是极限科技对国产搜索信创实践的一次集中输出。未来,极限科技将继续坚持自主创新路线,以 Easysearch 为基础,进一步完善企业级搜索、向量检索、AI 搜索和自主可控能力,推动搜索基础设施从“国产替代”走向“自主创新”,为企业数智化与 AI 应用发展构建更加安全、稳定、开放、可持续的搜索技术底座。
CDC、查询卸载与 AI 检索:达梦 × Easysearch 技术交流干货回顾
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 9889 次浏览 • 2026-08-14 11:14
在金融行业数字化转型与信创建设持续推进的背景下,如何让国产数据库更好地支撑海量数据检索、实时分析与智能应用,成为越来越多企业关注的话题。
8 月 7 日,围绕 “达梦数据库 × Easysearch 金融行业搜索与分析加速方案”,我们开展了一场技术主题分享与交流活动。 由 极限科技技术专家杨帆 从金融行业实际业务需求出发,深入介绍了达梦数据库与 Easysearch 的协同架构,并围绕数据同步、查询卸载、性能优化以及国产化生态合作等问题,与参会伙伴展开了深入交流。

本次分享的核心方案,是通过 “达梦数据库 + CDC 实时同步 + Easysearch” 构建事务与检索分析分离的架构:达梦继续承担核心事务处理和主数据管理,Easysearch 则承接全文搜索、海量数据检索、多维分析以及 AI 检索等场景,让两套系统各司其职,共同提升数据服务能力。
一、为什么需要“数据库 + 搜索引擎”?
传统关系型数据库在 OLTP 场景下具有强一致性、事务处理和数据管理等优势,但当业务逐渐面临海量数据全文检索、多维聚合分析以及复杂搜索体验等需求时,单纯依赖数据库往往会面临新的挑战。

例如在金融场景中,交易明细、合同与制度文件、客户信息、日志数据等都需要被快速检索;与此同时,大量报表、聚合分析和历史数据查询又可能与核心交易业务争抢 CPU、IO 等资源。
分享中提到,达梦擅长 OLTP 事务处理、强一致性、数据安全与审计等能力,而在全文检索、相关性排序以及海量检索分析等方面,则可以通过 Easysearch 进行能力补充。
因此,方案的核心思路并不是简单地“用 Easysearch 替换数据库”,而是:
让数据库专注事务,让搜索引擎专注搜索与分析。
达梦负责写入、更新、事务一致性以及主数据管理;Easysearch 则负责从海量数据中快速“找出来、关联起来”,承接搜索、聚合、向量检索及 AI 等查询型负载。
二、CDC:连接事务库与检索分析库的关键纽带
在这样的架构中,如何让达梦中的数据及时同步到 Easysearch,是大家非常关注的问题。

本次方案采用 CDC 实时同步 的方式,整体链路包括三个阶段:
全量同步 → 增量同步 → 持续运行
首先将达梦存量数据同步至 Easysearch,建立数据基线;随后通过 CDC 持续捕获 INSERT、UPDATE、DELETE 等数据变化,并实时同步到 Easysearch,最终形成持续运行的数据同步链路。
在分享介绍的测试验证中,达梦 DM8 × Easysearch 已完成兼容认证测试,全量同步和增量同步均验证通过;在 CDC 高压同步测试中,万级变更可在 30 秒内完成同步,并实现读写一致、无积压。
三、现场技术交流:从“方案介绍”走向“实际问题”
相比单向的技术分享,本次活动更加精彩的部分,是分享结束后的互动交流。
围绕方案在真实生产环境中的落地,参会伙伴提出了多个非常有针对性的问题,分享老师也结合方案设计和实际经验进行了逐一解答。
1. CDC 延迟一般是多少?
CDC 是整个架构实现近实时数据同步的关键,因此大家首先关注了:
从达梦发生数据变更,到 Easysearch 可以查询到数据,中间通常存在多大的延迟?
这个问题实际上不仅涉及 CDC 本身,还与源端产生变更的速度、网络、同步任务处理能力以及目标端写入性能等多个因素相关。

在常规业务负载下,CDC 增量同步延迟可控制在秒级;如果业务变更量更高,可通过 Easysearch 动态扩容分片、增加 CDC 同步并发等方式进一步降低延迟,满足金融级近实时数据一致性要求。
2. 哪些查询适合留在达梦?哪些查询适合放到 Easysearch?
这是现场非常有代表性的一个问题。
实际上,“哪些数据进入 Easysearch”并不是简单按照表来划分,而更应该按照 业务访问模式和查询类型 来判断。
例如:
- 强事务、强一致性的核心业务操作,继续留在达梦;
- 精确查询、事务处理以及主数据维护,继续由达梦负责;
- 全文搜索、模糊查询、相关性排序等场景,可以交给 Easysearch;
- 海量数据检索、多维聚合分析、历史数据查询等,可以通过 Easysearch 进行查询卸载;
- 面向 AI 的向量检索、混合检索和 RAG 等场景,则可以进一步利用 Easysearch 的搜索能力。
这种“按负载类型进行职责分工”的方式,也是整个方案设计的核心。

3. 从搜索到分析:Easysearch 还能解决什么?
除了传统的全文检索,本次分享还介绍了 Easysearch 在海量数据分析、向量检索以及 AI 场景中的应用。

在全文搜索方面,Easysearch 支持 IK、拼音、HanLP 等中文分词能力,并提供 BM25 相关性评分、Function Score、高亮、同义词、搜索建议等能力。
在海量数据分析方面,则可以通过倒排索引、列式 Doc Values 以及聚合能力,承接交易明细分析、日志检索、客户行为分析以及风控等场景。
而在 AI 场景中,Easysearch 还可以进一步提供向量检索和全文检索融合能力,为 RAG、语义搜索、智能客服、推荐以及反欺诈等应用提供检索底座。
这意味着,数据库中的结构化数据经过同步之后,并不只是多了一个“搜索入口”,而是可以进一步形成 搜索、分析与 AI 多种数据服务能力。
4. 在国产数据库信创领域,达梦与 Easysearch 有哪些合作空间?
二者都是信创全栈适配的国产自主产品,合作空间非常广阔:
首先是联合解决方案落地:面向金融、运营商、政企等行业,提供“事务库 + 检索分析库”的信创标准架构,满足等保、密评要求,规避开源组件协议风险;
其次是国产化替代场景:Easysearch 可作为 Elasticsearch 的平滑替代产品,与达梦组合形成“去 IOE + 去开源 Elastic ”的全栈信创方案,目前已在中国移动、中国一汽等标杆项目中验证;

此外还有AI场景拓展:二者结合可支撑金融 RAG 知识库、智能风控、语义合规审查等 AI 应用,为信创环境下的智能化转型提供底座。
四、一次分享,也是一次技术碰撞
从达梦数据库到 Easysearch,从 CDC 到查询卸载,再到全文搜索、海量分析和 AI 检索,本次交流虽然围绕的是一个具体的技术方案,但大家讨论的其实是一个更加普遍的问题:
在信创和数字化转型背景下,如何让不同类型的数据基础设施发挥各自的优势,并最终服务于业务?
达梦与 Easysearch 的组合,并不是简单的“1+1”,而是通过职责分离,让事务处理、数据管理、搜索、分析和 AI 各自发挥所长。
技术分享有终点,技术交流没有终点。
感谢分享嘉宾的精彩内容,也感谢每一位参会伙伴的积极参与和深度交流。
期待下一次,我们继续围绕 搜索、数据库、数据分析、AI 与信创技术,碰撞出更多新的思路与实践。
达梦 × Easysearch,探索国产数据基础设施协同的新可能。
参考资源:
- PPT 下载:https://searchkit.cn/slides/347
- 达梦官网:https://dameng.com
- Easysearch 官网:https://easysearch.cn
INFINI Easysearch 向量搜索实战(二)
向量搜索 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 10064 次浏览 • 2026-08-09 12:39

上回 我们通过 Ingest Pipeline 把数据在写入 Easysearch 的过程中自动转换成了向量,这次我们通过 Search Pipeline 实现查询时将查询内容转换成向量并进行查询。
Embedding 服务
这里要保持与写入时使用的模型一致。
实战
我们实战演示分为以下几个步骤:
- 建立 Search Pipeline
- 设置索引默认 Pipeline
- 数据查询
建立 Search Pipeline
PUT /_search/pipeline/default_model_pipeline
{
"rewrite_processors": [
{
"semantic_query_enricher" : {
"description": "Sets the default embedding model",
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "<api_key>",
"default_model_id": "text-embedding-v4",
"vector_field_model_id": {
"text_vector": "text-embedding-v4"
}
}
}
]
}

设置索引默认 Pipeline
为了方便查询,不用每次查询都指定 Pipeline,我们设置默认值。
PUT /my-index/_settings
{
"index.search.default_pipeline" : "default_model_pipeline"
}

数据查询
使用上次写入的数据进行查询测试,但不直接查询原来的文本内容。
GET /my-index/_search
{
"_source": "input_text",
"query": {
"semantic": {
"text_vector": {
"query_text": "非常先进高级的生产车间",
"candidates": 100,
"query_strategy": "LSH_COSINE"
}
}
}
}
参数解释请查看文档。

OK,从上面可以看到,我们没有直接搜索原文本中的内容或关键字,但还是通过文本的语义检索到了相关内容。

关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。
相关文章:
INFINI Easysearch 向量搜索实战(一)
向量搜索 • INFINI Labs 小助手 发表了文章 • 0 个评论 • 9504 次浏览 • 2026-08-09 12:35

Easysearch 提供了强大的向量搜索能力,打破传统关键词匹配的局限,实现真正的“懂你”的语义搜索。助力企业快速构建智能推荐、图像识别和内容理解等 AI 应用,释放数据深层价值。
核心能力
| 能力 | 说明 |
|---|---|
| 两种向量类型 | 稠密浮点向量(knn_dense_float_vector)和稀疏布尔向量(knn_sparse_bool_vector) |
| 多种索引模型 | lsh(局部敏感哈希,近似搜索)、permutation_lsh(置换 LSH)、sparse_indexed(倒排索引)、exact(精确搜索) |
| 多种相似度 | cosine(余弦)、l1(曼哈顿距离)、l2(欧氏距离)、jaccard、hamming |
| 与全文搜索融合 | 向量字段与文本字段存储在同一索引,支持 Hybrid 混合检索 |
| function_score 集成 | 向量相似度可作为 function_score 的评分函数 |
典型应用场景
- 语义搜索:文本通过 Embedding 模型转为向量,按语义相似度检索
- RAG 检索增强生成:为大语言模型提供知识库检索能力
- 推荐系统:用户/商品特征向量的相似推荐
- 图像/多模态搜索:图像特征向量的相似检索
- 去重与异常检测:通过向量距离判断内容相似度
Embedding 服务
在使用向量搜索前,先要准备一个 Embedding 模型,支持与 OpenAI API 兼容的 embedding 接口和 Ollama embedding 接口。本文使用阿里云上的 Embedding 模型进行演示。
写入方法
方法一:写入链路嵌入(推荐)
在数据写入 Easysearch 时,通过 Ingest Pipeline 自动调用 Embedding 服务:
应用写数据 → Easysearch → Ingest Pipeline → 调用 Embedding API → 写入向量字段
优势是写入后即可搜索,无需维护外部向量化流程。需要确保集群应至少有一个节点拥有 ingest 角色。
方法二:离线批处理
在应用侧完成向量化,再将向量字段直接写入 Easysearch:
原始数据 → 应用 → 调用模型 Embedding API → 写入 Easysearch(含向量字段)
参考文档。
实战
我们实战演示模式一,分为以下几个步骤:
- 建立带有向量字段的索引
- 创建对应的 Ingest Pipeline
- 写入数据到索引
1. 建立带有向量字段的索引
先建立一个带向量字段的索引,注意 dims 要与向量模型的输出匹配。
PUT /my-index
{
"mappings": {
"properties": {
"text_vector": {
"type": "knn_dense_float_vector",
"knn": {
"dims": 1024,
"model": "lsh",
"similarity": "cosine",
"L": 99,
"k": 1
}
}
}
}
}
2. 创建对应的 Ingest Pipeline
写入数据前先建立 Ingest Pipeline,注意 vendor 必须根据使用的模型来指定,比如本文使用的是阿里云 text-embedding-v4 模型,该模型提供了 OpenAI 格式的 API 接口,这里 vendor 我们就写 openai。
PUT _ingest/pipeline/text-embedding-pipeline
{
"description": "用于生成文本嵌入向量的管道",
"processors": [
{
"text_embedding": {
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "xxxxxx",
"text_field": "input_text",
"vector_field": "text_vector",
"model_id": "text-embedding-v4",
"dims": 1024,
"ignore_missing": false,
"ignore_failure": false
}
}
]
}
text_field:指定原始文本字段,Pipeline 会将该字段的内容转换成向量。
vector_field:指定向量存储的字段,保存上面转换的向量。
3. 写入数据
POST /_bulk?pipeline=text-embedding-pipeline&pretty
{"index": {"_index": "my-index", "_id": "1"}}
{"input_text": "苹果发布了新款iPhone 15 Pro手机,搭载A17芯片"}
{"index": {"_index": "my-index", "_id": "2"}}
{"input_text": "特斯拉宣布将在上海建第二座超级工厂"}
{"index": {"_index": "my-index", "_id": "3"}}
{"input_text": "今天天气真好,阳光明媚适合去公园散步"}
{"index": {"_index": "my-index", "_id": "4"}}
{"input_text": "程序员用Python写了一个自动化数据清洗脚本"}
{"index": {"_index": "my-index", "_id": "5"}}
{"input_text": "故宫博物院推出了夏季特展,展出珍贵文物"}
{"index": {"_index": "my-index", "_id": "6"}}
{"input_text": "小明每天坚持跑步五公里,身体越来越健康"}
{"index": {"_index": "my-index", "_id": "7"}}
{"input_text": "人工智能大模型在自然语言处理领域取得突破"}
{"index": {"_index": "my-index", "_id": "8"}}
{"input_text": "这家咖啡店的拿铁口感丝滑,推荐给咖啡爱好者"}
{"index": {"_index": "my-index", "_id": "9"}}
{"input_text": "量子计算机有望在药物研发中发挥重要作用"}
{"index": {"_index": "my-index", "_id": "10"}}
{"input_text": "周末和朋友一起去爬山,山顶的风景美极了"}

4. 检查数据
搜索索引数据,看看是否成功转换成了向量。可以看到原始数据保存在 input_text 字段中,其向量保存到了 text_vector。

OK,下一步我们看看怎么方便地实现向量搜索。

关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。
相关文章:
DBX:一款能连 Easysearch 的轻量开源桌面客户端来了
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 11219 次浏览 • 2026-08-07 09:56
在 Windows、macOS、Linux 或 Docker 环境中,使用 DBX 一个轻量桌面客户端完成 Easysearch 连接管理、索引浏览、文档操作与查询。

一个界面管理 Easysearch
DBX 是一款开源、轻量的数据库工具,支持 70 多种数据库与数据服务。针对 Easysearch,DBX 提供以下常用能力:
- 保存并管理 Easysearch 连接,支持用户名、密码、TLS/SSL 与代理配置;
- 展开连接后直接浏览当前账号有权访问的索引;
- 以表格或文档视图查看、筛选、排序和分页浏览文档;
- 在查询编辑器中执行 REST、Query DSL 与常用 SQL;
- 对具备写入权限的索引新增、修改或删除文档;
- 通过 DBX MCP 将已有连接提供给支持 MCP 的 AI 工具使用。
三步连接 Easysearch
本文截图与示例基于 DBX v0.5.71 和 Easysearch v2.3.1。连接测试、集群状态查询、索引浏览、文档搜索与写入能力均已在实际环境中完成验证。
1. 选择 Easysearch
打开 DBX,点击顶部的“新建连接”。在数据库类型列表中搜索并选择 Easysearch,然后点击“下一步”。

2. 填写连接信息
填写连接名称、主机、端口、用户名和密码。Easysearch 常用 HTTP 端口为 9200;如果服务使用 HTTPS,请在“TLS/SSL”页签中配置证书校验方式。
也可以直接粘贴完整连接 URL,由 DBX 自动解析连接参数。发布或分享截图时,请始终隐藏真实密码、内部地址和访问令牌。

3. 测试并保存
点击“测试”确认网络、账号和权限配置正确,再点击“保存并连接”。连接成功后,DBX 会在左侧连接树中展示当前账号可访问的索引。
连接失败时优先检查
服务地址与端口是否可达;用户名、密码和账号权限是否正确;HTTPS 证书链与主机名校验是否匹配;本机代理、隧道或防火墙是否允许访问目标服务。
浏览索引与文档
展开 Easysearch 连接并点击索引,DBX 会读取索引结构并加载文档。常见字段可以直接以表格形式展示,也可以切换到文档视图查看完整 JSON。

工具栏提供刷新、自动刷新、跳转列、新增行、提交和回滚等操作。对于具备写入权限的索引,可以直接在结果区域新增或修改文档,再统一提交变更。
需要缩小结果范围时,可以在筛选区域输入 JSON 条件。例如筛选指定分类:
{
"category": "compatibility"
}
需要使用完整 Query DSL 时,可以通过 $esQuery 传入查询对象:
{
"$esQuery": {
"match": {
"title": "Easysearch"
}
}
}
执行 REST、Query DSL 与 SQL
DBX 的 Easysearch 查询编辑器支持 METHOD /path 格式的 REST 请求。输入请求后,使用编辑器左侧的执行按钮或快捷键运行,即可在下方查看状态码和 JSON 响应。
例如,检查集群健康状态:
GET /_cluster/health

更多查询方式
执行 Query DSL:
POST /products/_search
{
"query": {
"match": {
"name": "database"
}
}
}
对于 Easysearch 当前版本支持的常用 SQL,也可以直接输入:
SELECT title, category, score FROM products ORDER BY score DESC LIMIT 20;
DBX 会将兼容响应转换为结果表格。遇到 Elasticsearch 版本差异、专有扩展或 SQL 兼容性限制时,建议改用明确的 REST 与 Query DSL 请求,以便准确控制请求路径和参数。
与 AI 工具协作
启用 DBX MCP 后,支持 MCP 的 AI 编码工具可以复用 DBX 中保存的 Easysearch 连接,在现有访问策略下执行查询,无需在提示词或聊天记录中重复填写连接密码。
生产环境建议
为 AI 工具单独准备只读或受限账号,明确允许访问的索引范围,并保持文档写入、删除索引等高风险操作默认关闭。
下载与反馈
Easysearch 官网:https://easysearch.cn
DBX 官网:https://dbxio.com
DBX 下载:https://github.com/t8y2/dbx/releases
DBX GitHub:https://github.com/t8y2/dbx
如果你正在使用 Easysearch,可以下载 DBX 体验连接管理、索引浏览、文档操作和查询能力。遇到兼容性问题或有新的使用建议,欢迎在 DBX GitHub 仓库提交 Issue。
Easysearch 2.3.1 发布:强化集群运维能力,优化写入性能与稳定性体验
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 10120 次浏览 • 2026-08-06 18:23

INFINI Easysearch 2.3.1 正式发布。本版本围绕企业级搜索服务的运维管理、安全控制和性能优化持续演进,新增更全面的巡检信息采集能力,增强集群服务管理约束,优化文档写入与 mapping 解析性能,并针对 S3 兼容存储、CCR 恢复、UI 管理等场景修复多项问题,进一步提升系统稳定性、兼容性与生产环境使用体验。
Easysearch 本次更新如下:
功能特性 (Features)
- 巡检 UI 新增集群状态、模板、索引元数据、快照、集群运行时信息、节点信息、插件、节点诊断信息及分片/段信息等采集项,提升问题诊断覆盖范围。
- 服务管理 UI 的创建和加入集群流程新增节点角色约束,协调节点不能与 master、data、ingest 角色同时选择。
- 服务管理登录时增加 root 账户限制检测,避免以 root 账户访问受管服务。
改进优化 (Improvements)
- 新增 S3
disable_bulk_delete配置(客户端名称空间为s3.client.<name>.disable_bulk_delete,默认false);启用后批量删除路径会逐个调用DeleteObject,用于兼容不支持DeleteObjects的 S3 兼容存储。 - 持续完善
source_reuse的写入和读取重建,提升复杂 mapping 场景下的兼容性和性能;包含nestedmapping 的索引改用完整_source,已有索引动态加入nestedmapping 后需 reindex。 - 优化文档写入与 mapping 解析热路径,减少 JSON/XContent、日期和点号字段解析中的对象创建与重复处理,提升批量索引吞吐。
- 巡检任务默认不再勾选“数据样本”采集;需要时仍可手动启用,降低默认采集真实索引数据的风险。
问题修复(Bug Fixes)
- 修复开启安全认证且根路径不允许匿名访问时,Easysearch UI 因登录前探测根路径而无法登录的问题。
- 修复 Agent 服务管理中可通过服务列表或巡检入口绕过服务登录状态的问题。
- 修复编辑集群配置时可能意外重置管理员密码的问题。
- 修复巡检页面无法正确解析服务版本的问题。
- 修复开发工具中缓存的集群名称、标识与实际集群信息不同步的问题。
- 修复 Java 21 环境下 CCR 初始恢复并发读取文件时可能触发
IllegalStateException: confined并导致恢复失败的问题。
以上为本版本重点更新摘要,更多详情请查看 Easysearch 产品 Release Notes 或联系我们的技术支持团队!
获取新版本
INFINI Easysearch v2.3.1 已正式发布,欢迎升级体验:
- 下载地址:https://infinilabs.cn/download/
- 快速开始:https://docs.infinilabs.com/easysearch/main/docs/quick-start/
关于 Easysearch

INFINI Easysearch 是一款分布式搜索引擎,支持结构化和非结构化的数据检索、全文检索、向量检索、空间地理位置信息检索、组合查询、多语种支持、语义分析和聚合分析等多种功能。
Easysearch 基于 Lucene 构建,紧跟 Lucene 最新版本持续迭代更新,采用商用友好协议,企业可自由部署、二次开发和商业化,无协议合规风险。
Easysearch 致力于为企业提供轻量、安全、自主可控的搜索平台,不断完善产品能力,满足更多企业级需求。

INFINI Easysearch 向量搜索实战(一)
Easysearch • INFINI Labs 小助手 发表了文章 • 0 个评论 • 14021 次浏览 • 2026-07-18 19:38

Easysearch 提供了强大的向量搜索能力,打破传统关键词匹配的局限,实现真正的“懂你”的语义搜索。助力企业快速构建智能推荐、图像识别和内容理解等 AI 应用,释放数据深层价值。
核心能力
| 能力 | 说明 |
|---|---|
| 两种向量类型 | 稠密浮点向量(knn_dense_float_vector)和稀疏布尔向量(knn_sparse_bool_vector) |
| 多种索引模型 | lsh(局部敏感哈希,近似搜索)、permutation_lsh(置换 LSH)、sparse_indexed(倒排索引)、exact(精确搜索) |
| 多种相似度 | cosine(余弦)、l1(曼哈顿距离)、l2(欧氏距离)、jaccard、hamming |
| 与全文搜索融合 | 向量字段与文本字段存储在同一索引,支持 Hybrid 混合检索 |
| function_score 集成 | 向量相似度可作为 function_score 的评分函数 |
典型应用场景
- 语义搜索:文本通过 Embedding 模型转为向量,按语义相似度检索
- RAG 检索增强生成:为大语言模型提供知识库检索能力
- 推荐系统:用户/商品特征向量的相似推荐
- 图像/多模态搜索:图像特征向量的相似检索
- 去重与异常检测:通过向量距离判断内容相似度
Embedding 服务
在使用向量搜索前,先要准备一个 Embedding 模型,支持与 OpenAI API 兼容的 embedding 接口和 Ollama embedding 接口。本文使用阿里云上的 Embedding 模型进行演示。
写入方法
方法一:写入链路嵌入(推荐)
在数据写入 Easysearch 时,通过 Ingest Pipeline 自动调用 Embedding 服务:
应用写数据 → Easysearch → Ingest Pipeline → 调用 Embedding API → 写入向量字段
优势是写入后即可搜索,无需维护外部向量化流程。需要确保集群应至少有一个节点拥有 ingest 角色。
方法二:离线批处理
在应用侧完成向量化,再将向量字段直接写入 Easysearch:
原始数据 → 应用 → 调用模型 Embedding API → 写入 Easysearch(含向量字段)
参考文档。
实战
我们实战演示模式一,分为以下几个步骤:
- 建立带有向量字段的索引
- 创建对应的 Ingest Pipeline
- 写入数据到索引
1. 建立带有向量字段的索引
先建立一个带向量字段的索引,注意 dims 要与向量模型的输出匹配。
PUT /my-index
{
"mappings": {
"properties": {
"text_vector": {
"type": "knn_dense_float_vector",
"knn": {
"dims": 1024,
"model": "lsh",
"similarity": "cosine",
"L": 99,
"k": 1
}
}
}
}
}
2. 创建对应的 Ingest Pipeline
写入数据前先建立 Ingest Pipeline,注意 vendor 必须根据使用的模型来指定,比如本文使用的是阿里云 text-embedding-v4 模型,该模型提供了 OpenAI 格式的 API 接口,这里 vendor 我们就写 openai。
PUT _ingest/pipeline/text-embedding-pipeline
{
"description": "用于生成文本嵌入向量的管道",
"processors": [
{
"text_embedding": {
"url": "https://dashscope.aliyuncs.com/compatible-mode/v1/embeddings",
"vendor": "openai",
"api_key": "xxxxxx",
"text_field": "input_text",
"vector_field": "text_vector",
"model_id": "text-embedding-v4",
"dims": 1024,
"ignore_missing": false,
"ignore_failure": false
}
}
]
}
text_field:指定原始文本字段,Pipeline 会将该字段的内容转换成向量。
vector_field:指定向量存储的字段,保存上面转换的向量。
3. 写入数据
POST /_bulk?pipeline=text-embedding-pipeline&pretty
{"index": {"_index": "my-index", "_id": "1"}}
{"input_text": "苹果发布了新款iPhone 15 Pro手机,搭载A17芯片"}
{"index": {"_index": "my-index", "_id": "2"}}
{"input_text": "特斯拉宣布将在上海建第二座超级工厂"}
{"index": {"_index": "my-index", "_id": "3"}}
{"input_text": "今天天气真好,阳光明媚适合去公园散步"}
{"index": {"_index": "my-index", "_id": "4"}}
{"input_text": "程序员用Python写了一个自动化数据清洗脚本"}
{"index": {"_index": "my-index", "_id": "5"}}
{"input_text": "故宫博物院推出了夏季特展,展出珍贵文物"}
{"index": {"_index": "my-index", "_id": "6"}}
{"input_text": "小明每天坚持跑步五公里,身体越来越健康"}
{"index": {"_index": "my-index", "_id": "7"}}
{"input_text": "人工智能大模型在自然语言处理领域取得突破"}
{"index": {"_index": "my-index", "_id": "8"}}
{"input_text": "这家咖啡店的拿铁口感丝滑,推荐给咖啡爱好者"}
{"index": {"_index": "my-index", "_id": "9"}}
{"input_text": "量子计算机有望在药物研发中发挥重要作用"}
{"index": {"_index": "my-index", "_id": "10"}}
{"input_text": "周末和朋友一起去爬山,山顶的风景美极了"}

4. 检查数据
搜索索引数据,看看是否成功转换成了向量。可以看到原始数据保存在 input_text 字段中,其向量保存到了 text_vector。

OK,下一步我们看看怎么方便地实现向量搜索。

关于 Easysearch

INFINI Easysearch 是一个分布式的搜索型数据库,实现非结构化数据检索、全文检索、向量检索、地理位置信息查询、组合索引查询、多语种支持、聚合分析等。Easysearch 可以完美替代 Elasticsearch,同时添加和完善多项企业级功能。Easysearch 助您拥有简洁、高效、易用的搜索体验。
官网文档:https://docs.infinilabs.com/easysearch
相关文章:

