Easysearch 容量规划建议

基于容量估算 #

主要问题： #

每天将索引多少原始数据（GB）？保留数据多少天？
原始数据膨胀率
您将强制执行多少个副本分片？
您将为每个数据节点分配多少内存？
您的内存:数据比例是多少？

原则 #

保留 +15% 以保持在磁盘水位以下。
保留 +5% 用于误差和后台活动的余量。
保留相当于一个数据节点的资源来处理故障。

公式： #

总数据量 GB = 原始数据 GB/天 * 保留天数 * 膨胀率 * (副本数 + 1)

总存储 GB = 总数据 GB * 1.15（包括磁盘 watermark threshold 和误差范围）

总数据节点数 = ROUNDUP(总存储 GB / (每个数据节点的内存 * 内存/数据比例)) + 1（用于故障转移）

举例： #

假设需要存储的源数据 50TB 大小

膨胀率 10% 副本数 1

每个节点 256G 内存

计算出：

总数据量 TB #

= 50TB * (1 + 0.10) * (1 + 1)

= 110TB

总存储 TB #

= 110TB * 1.15（考虑磁盘 watermark threshold 和误差范围）

= 126.5TB

如果有 256GB 的物理内存，128GB 会用于 JVM 堆，剩下的 128GB 将用于操作系统、文件缓存和其他系统进程。

按照常见的 1:30 的 RAM 到磁盘比例来计算，那么每个节点能处理的数据存储大约是：

256GB 内存 * 30 = 7680GB，大约等于 7.68TB

总数据节点数 #

= ROUNDUP(126.5TB / 7.68TB) + 1（用于故障转移）

= ROUNDUP(16.47) + 1

= 18

基于搜索吞吐量估算 #

在存储容量层面之外，还要考虑搜索响应时间和搜索吞吐量的目标，这些目标可能需要更多的内存和计算资源。

搜索响应时间受太多变量的影响，无法预测任何给定容量计划会如何影响它。但通过经验性测试搜索响应时间并估计预期的搜索吞吐量，我们可以估算出满足这些需求所需的集群资源。

主要问题： #

你每秒的最高搜索次数是多少？
你的平均搜索响应时间（毫秒）是多少？
你的数据节点上有多少个核心和每个核心有多少个线程

经验方法： #

与其确定资源将如何影响搜索速度，不如将搜索速度视为一个常数，通过在计划的硬件上进行测量来处理。然后确定集群需要多少个核心来处理预期的搜索吞吐量峰值。最终目标是防止线程池队列增长速度超过它们被消耗的速度。如果计算资源不足，搜索请求有被丢弃的风险。

公式： #

峰值线程数 = 向上取整（每秒的峰值搜索次数 * 平均搜索响应时间（毫秒） / 1000 毫秒）

线程池大小 = 向上取整（（每个节点的物理核心数 * 每个核心的线程数 * 3 / 2） + 1）

总数据节点数 = 向上取整（峰值线程数 / 线程池大小）

举例： #

假设每秒 2 万搜索请求，平均响应时间 50 毫秒，每个节点有 16 个线程数，计算需要多少节点

峰值线程数 = 20000 * 50 /1000 = 1000

线程池大小 = (16 * 1 * 3/2) + 1 = 25

总数据节点数 = 1000 / 25 = 40

大概需要 40 个数据节点来处理每秒 2 万的搜索请求，平均响应时间为 50 毫秒，每个节点有 16 个线程。这是一个粗略的估计，实际需求可能会因多种因素而有所不同。建议进行实际测试以确认这些数字。

Hot, Warm, Frozen #

根据索引使用情况不同，通常分为种存储。这是一种经济高效的方法，用于存储大量数据，同时优化了对较新数据的性能。在容量规划期间，每个层次必须独立进行规模确定，然后进行合并。

层面	目标	示例存储	示例内存：存储比
Hot	搜索为主	SSD DAS/SAN (>200Gb/s)	1:30
Warm	存储为主	HDD DAS/SAN (~100Gb/s)	1:100
Frozen	存档为主	Cheapest DAS/SAN (<100Gb/s)	1:500

实际情况要把搜索吞吐量估算和容量估算结合考虑。

张磊

追求极致，无限可能。

· TDBC 2025 大会聚焦 AI 与数据库融合，极限科技发布新一代 Coco AI 搜索平台 · 极限科技 Coco AI 荣获 2025 首届人工智能应用创新大赛全国一等奖 · 搜索型数据库的技术发展历程与趋势前瞻 · 极限网关助力好未来 Elasticsearch 容器化升级 · 国产搜索引擎崛起：Elasticsearch 国产化加速

· INFINI Labs 产品更新 | Easysearch 2.1.0 新增高性能 Rules 规则引擎插件,数据探索 Discover 等 · Easysearch ZSTD 基准测试：高压缩率下实现近 5 倍查询吞吐 · 极限科技开源赞助计划：欢迎开源项目申请支持 · 捷报传来！极限科技 Coco AI 团队荣获第二届“兴智杯”总决赛二等奖 · 探索低空经济“关键一跃” —— 技术如何驱动商业落地线上研讨会圆满举办 · 极限科技荣膺 2025 金猿奖 — “年度国产化优秀代表厂商”，自主可控搜索方案 Easysearch 获行业高度认可 · 极限科技 Coco AI 荣获 2025 IT168 技术卓越奖 - 创新产品奖 · APM（三）：监控 Python 服务链 · INFINI Labs 产品更新 | Coco AI v0.10 × Easysearch v2.0 联袂上线：UI 全面重构，体验焕然一新 · Easy-Es 2.1.0-easysearch 版本发布

Easysearch x

产品更新 x

performance x

2026 x

开源 x

赞助 x

开源生态 x

社区 x

Coco AI x

二等奖 x

兴智杯 x

人工智能 x

赛事 x

低空经济 x

商业化 x

数据分析 x

金猿奖 x

国产化 x

搜索引擎 x

技术卓越奖 x

创新产品奖 x

IT168 x

APM x

Skywalking x

Easy-Es x

Coco x

AI x

GitLab x

代码审核 x

石油石化 x

Gitee x

投票 x

Meilisearch x

Rust x

轻量级 x

搜索百科 x

Docker x

Docker Compose x

Easyserach x

Console x

DevOps x

Elasticsearch x

国产替代 x

backup x

snapshot x

CCR x

Gateway x

esdump x

source_reuse x

ignore_above x

OpenSearch x

AWS x

Lucene x

Solr x

Easyearch x

发明专利 x

数据分区 x

国际专利 x

一等奖 x

人工智能应用创新大赛 x

bulk x

embedding x

OpenAI x

IK x

TDBC x

2025 x

信通院 x

可信数据库大会 x

搜索型数据库 x

中国数据库产业图谱 x

上海开源创新菁英荟 x

开源创新新星企业 x

Workshop x

AI 搜索 x

智能助手 x

Automation x

Logstash x

MongoDB x

开源中国 x

直播 x

merge x

Elasticsearch 9 x

GitCode x

AI搜索 x

Cloud x

rollup x

Kubernetes x

Operator x

Arm64 x

Snapshot x

S3 x

Grafana x

Opensearch x

Nginx x

直播活动 x

搜索客社区 x

Meetup x

ES x

企业搜索 x

DeepSeek x

RAG x

certificate x

windows x

Rollup x

TopN x

Filebeat x

Ubuntu x

请求限速 x

INFINI Console x

指标 x

Kibana x

多集群 x

client x

Spring Boot x

ECE x

ES Bulk x

vector database x

Postgres x

可搜索快照 x

SDK x

官网 x

Web 开发 x

Next.js x

React x

Three.js x

Metrics x

Helm x

filter x

querycache x

practice x

Agent x

localStorage x

响应式 x

时间组件 x

时区组件 x

极限科技 x

三周年 x

周年庆 x

国家高新技术企业 x

校园招聘 x

湖北工业大学 x

Tauri x

Web 开发人员 x

桌面应用开发 x

桌面端 x

Electron x

Pizza x

认证培训 x

报名 x

Scrapy x

爬虫 x

Rust开发者大会 x

docsearch x

文档搜索 x

Easyseach x

有奖征文 x

黑神话悟空 x

EKS x

征文系列 x

跨集群搜索 x

科技中小企业 x

白皮书 x

Python SDK x

数据库产业图谱 x

超大规模 x

分布式集群 x

写入限流 x

2024可信数据库发展大会 x

创新型中小企业 x

搜索数据库 x

正排索引 x

免费许可证 x

K8S x

DTC2024 x

实时搜索 x

ES国产化 x

Redis x

OOM x

测试 x

内存 x

趋势 x

AI绘画 x

Stable Diffusion x

Diffusion x

Model x

GAN x

语义搜索 x

知识图 x

向量数据库 x

中国信通院 x

星河（Galaxy） x

标杆案例 x

鲲鹏 x

鲲鹏技术认证 x

客户端 x

日志平台 x

LDAP x

Loadgen x

中国一汽 x

国内数据库 x

墨天轮 x

监控系统 x

集成测试 x

ZSTD x

Helm Charts x

国产适配 x

兆芯 x

Linux x

LoongArch x

信创适配 x

二维拆分算法 x

中国移动云 x

Vault x

加密 x

安全工具 x

kNN x

向量检索 x

图片搜索 x

Alerting x

SQL x

搜索 x

Embedding x

可信数据库 x

统信 x

海光 x

龙芯 x

restore x

Arm x

大数据企业证书 x

移动云大会 x

信通院产品评测 x

国内首家 x

数据可视化 x

北京软协 x

第十届理事会会员单位 x

Apache Arrow x

宣传片 x

大会分享 x

多集群管理 x

无缝数据迁移 x

Loadrun x

INFINI Gateway x

log4j x

基于容量估算 #

主要问题： #

原则 #

公式： #

举例： #

总数据量 TB #

总存储 TB #

总数据节点数 #

基于搜索吞吐量估算 #

主要问题： #

经验方法： #

公式： #

举例： #

Hot, Warm, Frozen #

相关文章