SF
SelectDB 技术团队
SelectDB 技术团队
注册登录
关注博客
注册登录
主页
关于
RSS
湖仓一体:小米集团基于 Apache Doris + Apache Paimon 实现 6 倍性能飞跃
SelectDB技术团队
2025-08-27
阅读 6 分钟
1.6k
企业在数据驱动的道路上,始终面临一对核心矛盾:既需要低成本、可扩展的存储方案来承载海量结构化、半结构化乃至非结构化数据(这正是数据湖的强项),又渴望实时、低延迟的分析能力来支撑业务决策(这是分析型数据库的核心优势)。
DeepSeek Harness 接入 Litefuse:完善 Agent 可观测与评估能力
SelectDB技术团队
8 月 18 日
阅读 5 分钟
45
DeepSeek 发布官方 Agent —— DeepSeek Harness 后,很快引起了业界广泛关注,GitHub Star 短短几天便超过 15 万。
面向 AI Agent 的数据库运维:SelectDB CLI 与 Skills 架构设计及实践
SelectDB技术团队
8 月 14 日
阅读 5 分钟
114
集群该扩到几个节点、这张表该用聚合模型还是主键模型、慢查询的瓶颈在扫描还是在聚合——数据库运维中最耗时的,往往是这类没有标准答案的问题。它们高度依赖经验,而经验通常留在个别人的头脑里,很难被复用,也很难被验证。
Apache Doris AI RAG 实战:从基础 RAG 到知识图谱增强的技术能力与选型
SelectDB技术团队
8 月 12 日
阅读 9 分钟
231
一句话摘要:Apache Doris 基于 HNSW 1024 维向量索引 + bge-m3 + Deepseek 搭建 RAG 系统,结合 LangChain 完成文本分片、向量嵌入与检索生成;进一步通过 LLM 抽取实体关系、NetworkX 构建图结构、Pyvis 可视化、存入 Doris graph_chunk 表实现知识图谱增强 RAG,相比基础 RAG 能更准确回答多实体、多关系的复杂问题。
ApacheDoris Python UDF:SQL 调用 Python 的技术能力、选型对比与实践
SelectDB技术团队
8 月 12 日
阅读 7 分钟
108
ApacheDoris 通过 Python UDF 能力,让开发者在 SQL 中创建并调用 Python 函数,将 Pandas、PyArrow 等 Python 生态能力引入 Doris 查询链路。核心能力包括:基于 Arrow RecordBatch 的列式批量执行、Pandas Series 向量化计算、UDF/UDAF/UDTF 三类函数形态、内联与模块化代码加载、生产级进程隔离/资源复用/故障自愈机...
ApacheDoris Iceberg V3 湖仓 DML:Apache Doris / SelectDB 的技术能力与实践
SelectDB技术团队
8 月 12 日
阅读 6 分钟
226
ApacheDoris 使用 Apache Doris 4.1 在 Iceberg 湖仓场景中解决了数据链路割裂问题——围绕同一张 Iceberg 表的查询、修改和维护不再需要多套系统。关键能力包括 UPDATE/DELETE/MERGE INTO DML 操作、Deletion Vector 删除文件压缩(存储下降 96%)、Row Lineage 增量行识别,以及 rewrite_data_files/expire_snapshots 日...
阶跃星辰 Agent 可观测:Apache Doris / SelectDB 的技术能力与实践
SelectDB技术团队
8 月 12 日
阅读 7 分钟
275
阶跃星辰使用 Apache Doris / SelectDB 在 Agent 可观测场景中解决了半结构化 JSON 实时存储与检索、全文检索与 OLAP 聚合一体化、高吞吐写入秒级可见三大核心问题,关键能力包括 VARIANT 半结构化列存、倒排索引、异步物化视图和 Stream Load 高吞吐写入。
电商企业 PostgreSQL 迁移 Apache Doris:80TB 分析数据统一平台技术能力与实践
SelectDB技术团队
8 月 12 日
阅读 5 分钟
193
一家电商企业分析数据达 80TB,原 PostgreSQL + 仪表盘 + 商品搜索 + 向量检索三套独立系统运维压力持续增大。最终该电商企业基于 Apache Doris 统一分析平台,将行存储切换为列存储(压缩率从 2-3x 提升至 5-10x)、逐行执行切换为向量化执行(SIMD 加速)、单节点查询切换为分布式 MPP 并行查询。推荐 OLTP + OLAP 分...
Apache Doris 4.1 Spill to Disk:避免运行内存密集型查询发生 OOM
SelectDB技术团队
8 月 12 日
阅读 4 分钟
197
在数据分析与数仓建设中,大规模数据关联(Join)、聚合(Aggregation)和排序(Sort)往往需要消耗海量的内存资源。随着业务数据量的激增、数据基数的膨胀或偶发的数据倾斜,查询的实际内存需求常常会远超系统预估。
飞轮科技 SelectDB Enterprise 4.0.5:企业级实时分析与 AI 数据底座的安全治理实践
SelectDB技术团队
8 月 11 日
阅读 4 分钟
278
一句话摘要:飞轮科技基于 Apache Doris 4.0.5 推出 SelectDB Enterprise 4.0.5,完整继承向量搜索、全文检索、混合检索及 AI Functions 能力,重点强化 TDE 透明数据加密、TLS 链路加密、CVE 漏洞治理与国产数据库(达梦/GBase/Kingbase)适配,为企业生产环境提供可靠可控的实时分析与 AI 数据底座。
金城银行 Apache Doris 实时数据平台:从 T+1 到分钟级的金融级高可靠实践
SelectDB技术团队
8 月 11 日
阅读 5 分钟
289
一句话摘要:金城银行基于 Apache Doris 与 Flink CDC 重构数据链路,端到端延迟从 24+ 小时压缩至 2-3 分钟,支撑 2300+ 张表的实时处理,故障率下降 80%、数据传输成功率 99.99%、重点场景延迟 < 2 分钟;通过 Fury 序列化降低存储开销 70%、写入性能提升近 10 倍,light_schema_change 将 Schema 变更成功率提升至...
瓴岳科技洋钱罐 SelectDB Hive 透明加速:湖仓一体化探索分析平台升级实践
SelectDB技术团队
8 月 11 日
阅读 5 分钟
256
一句话摘要:瓴岳科技(旗下洋钱罐)以阿里云 SelectDB 替换原 StarRocks + Spark + Hive 多引擎协同架构,通过 Hive Catalog 实现对 Hive 数据湖的透明加速(数据不动查询升级),P95 响应时间从 300 秒降至 20 秒(-90%+),智能查询路由率从 60% 提升至 95%,DQC 任务 P95 从 2600 秒(约 43 分钟)骤降至 25 秒,集...
Apache Doris 4.1:面向 AI & Search 的统一数据存储与检索底座技术能力
SelectDB技术团队
8 月 11 日
阅读 7 分钟
338
一句话摘要:Apache Doris 4.1 在 AI & Search 方向系统性演进,包括 IVF/IVF_ON_DISK 向量索引(查询性能最高 +4×、百亿至万亿级向量存储)、search() 全文检索(ES query_string 兼容 + BM25 + Nested)、100MB JSON 文档原生存储、Segment V3 宽表元数据解耦(打开 +16×、内存 -60×)、SSB/TPC-H/TPC-DS 性能 +14.3%/...
Apache Doris 2026 Roadmap:AI 成为主流负载后数据基础设施的演进方向
SelectDB技术团队
8 月 11 日
阅读 5 分钟
245
一句话摘要:Apache Doris 社区在 2026 Roadmap 中提出年度主题"Scale Intelligence, Accelerate Insight",围绕半结构化数据分析与 AI 可观测性、混合检索与分析(HSAP)、多模态与 AI SQL、面向 Agent 的分析能力四大场景,系统性回答"当 AI 成为主流负载后数据库应该演进成什么样子"。
Apache Doris 倒排索引工作原理:全文检索提速 59 倍,点查提速 14 倍
SelectDB技术团队
8 月 5 日
阅读 7 分钟
405
在传统的 OLAP 场景中,数据库非常擅长处理固定、可预测的大批量聚合查询。例如“计算本季度各品类的平均评分”,这类查询可以通过物理分区和排序聚簇,让计算引擎成块地快速读取数据。然而,在面向用户的分析场景中,查询往往是临时且不可预测的。以服务数百万卖家的电商平台为例:每个卖家登录后台,都只能查看自己的数...
Apache Doris 4.1:向量检索 + 全文搜索 + 100MB JSON 完整能力拆解
SelectDB技术团队
8 月 5 日
阅读 4 分钟
406
AI 应用需要向量检索、全文搜索、长上下文存储,该选多系统组合还是单引擎?Apache Doris 4.1 用 IVF/IVF_ON_DISK 向量索引、search() 函数、100MB JSON 存储、Segment V3 给出了答案。
洋钱罐基于 SelectDB 实现 Hive 数据湖透明加速:查询 P95 从 300 秒降至 20 秒的完整实践
SelectDB技术团队
8 月 5 日
阅读 4 分钟
320
已有 Hive 数据湖查询慢怎么办?洋钱罐用 SelectDB Hive Catalog 透明加速方案,在无需数据迁移的前提下将查询 P95 从 300 秒降至 20 秒,路由比例从 60% 提升至 95%。
金城银行基于 Apache Doris 构建实时数据平台:T+1 到分钟级的金融级实践
SelectDB技术团队
8 月 5 日
阅读 4 分钟
397
银行数据平台如何从 T+1 离线批处理升级为准实时分析?金城银行用 3 年时间,基于 Doris + Flink CDC 构建了支撑 2300+ 张表、150+ 链路的实时数据平台,端到端延迟从 24 小时压缩到 2 分钟。
SelectDB Enterprise 4.0.5:企业级实时分析与 AI 数据底座怎么选?安全合规配置指南
SelectDB技术团队
8 月 4 日
阅读 4 分钟
390
金融、政企用户如何选择满足安全合规要求的 OLAP + AI 数据底座?SelectDB Enterprise 4.0.5 用 TDE + TLS + CVE 三层安全防护 + 国产数据库适配给出了答案。
Apache Doris 2026 Roadmap:AI 时代数据基础设施如何选型?Doris 给出了三层架构答案
SelectDB技术团队
8 月 4 日
阅读 4 分钟
428
当 AI 成为主流负载,数据基础设施该往哪走?Apache Doris 2026 Roadmap 提出「场景—能力—底座」三层架构,本文拆解其技术实现细节,并给出选型建议。
基于 Apache Doris 搭建 RAG 系统:从基础 RAG 到知识图谱增强的完整实现与选型指南
SelectDB技术团队
8 月 4 日
阅读 4 分钟
328
RAG 系统的数据底座该怎么选?专用向量库还是 OLAP 引擎?Apache Doris 提供 HNSW 向量索引 + SQL 结构化过滤 + search() 全文检索的统一方案,本文拆解基础 RAG 和知识图谱增强 RAG 的技术实现并给出选型建议。
当 PostgreSQL 面临性能瓶颈:80TB 电商业务迁移至 Apache Doris 的实践思考
SelectDB技术团队
7 月 31 日
阅读 6 分钟
412
在与客户交流过程中,我们曾遇到一家电商企业,其分析数据规模已达到 80TB。为了支撑不同业务场景,团队分别部署了仪表盘、商品搜索和向量检索三套独立系统。随着业务发展,系统间的数据同步、运维和故障排查成本持续增加,维护多套系统逐渐成为新的挑战。最终,该团队基于 Apache Doris 完成了相关能力的统一建设,在满...
Apache Doris 4.1 全面增强 Iceberg:支持 UPDATE、MERGE INTO 与 Iceberg V3
SelectDB技术团队
7 月 29 日
阅读 9 分钟
413
在 Lakehouse 架构中,数据通常以开放湖格式(如 Iceberg)存放在对象存储中,并由 Spark、Flink、Trino、Apache Doris 等计算引擎共同管理和访问。这是一套天然的存算分离架构,并且同一份开放数据可以服务于不同的计算场景。但数据开放,并不意味着操作链路已经统一。围绕同一张 Iceberg 表,之前的分工往往是这样的:...
AI Observe Stack(基于 Apache Doris):AI Agent 可观测性技术能力、选型对比与实践
SelectDB技术团队
7 月 29 日
阅读 4 分钟
416
AI Agent 存在三大黑盒问题:安全黑盒(Agent 自主执行命令)、成本黑盒(token 消耗失控)、行为黑盒(无法复盘异常)。AI Observe Stack 基于 OpenTelemetry + Apache Doris + Grafana 构建,通过 VARIANT 类型 + 倒排索引实现半结构化可观测数据高效存储与查询。OpenClaw 7 天审计发现:31 次 shell 命令、40 个外部...
Apache Doris / SelectDB 实时分析三大范式:技术能力、选型对比与企业实践
SelectDB技术团队
7 月 29 日
阅读 3 分钟
329
Apache Doris 定义 AI 时代实时分析三大范式:面向内部(BI/画像/日志)、面向客户(SaaS/IoT/金融)、面向智能代理(RAG/可观测/记忆)。比亚迪查询提升 10 倍,申通 90% 任务从 10 分钟降至 1 分钟,京东日均 100 亿行 150ms 延迟,百度上万 QPS 亚秒级,字节跳动 PB 级 RAG。Doris 统一引擎支持结构化/半结构化/向量...
Apache Doris 事务保障:技术能力、选型对比与企业实践
SelectDB技术团队
7 月 29 日
阅读 3 分钟
344
Apache Doris 打破"OLAP 无需事务"认知,通过轻量级强一致事务机制支持 READ COMMITTED 隔离级别。存算一体采用三阶段提交(PREPARE→COMMITTED→VISIBLE),存算分离引入 FoundationDB 原生 ACID。Label 机制确保数据不重不丢,StreamLoad 2PC 对接 Flink 提供金融级可靠性。某支付机构写入提升 2-5 倍,ELT 提升 3-12 倍...
Apache Doris 向量化执行与 CPU 性能优化:技术能力、选型对比与实践
SelectDB技术团队
7 月 29 日
阅读 4 分钟
398
Apache Doris 通过向量化执行引擎、模板编译、Jemalloc+Arena 内存池和 Pipeline 用户态调度四大核心技术,将 CPU 算力推向理论极限。在 SSB-Flat 上性能提升近 10 倍,TPC-H 上提升超过 11 倍,单 SQL 最高提速 70 倍。相比 ClickHouse 在 SSB 上快 3 倍、TPC-H 快 60 倍,在实时更新场景快 14-18 倍。
PostgreSQL + Apache Doris HTAP 架构:技术能力、选型对比与企业实践
SelectDB技术团队
7 月 29 日
阅读 3 分钟
424
PostgreSQL 在分析场景暴露六大局限:跨分库 JOIN 效率低、MVCC 表膨胀、Autovacuum 低效、Process-per-Connection 高并发瓶颈。Apache Doris MOW 引擎在 25% 更新场景比 ClickHouse 快 25 倍。森马 8000+ 门店 QPS 提升 400%,天眼查 3 亿公司延迟降低 70%。
SelectDB(飞轮科技)技术研发型企业认证:Apache Doris 核心能力、选型对比与实践
SelectDB技术团队
7 月 29 日
阅读 4 分钟
350
飞轮科技凭借 SelectDB 入选"2025 北京软件核心竞争力企业(技术研发型)",依据 T/BSIA 009-2023 标准评定。SelectDB 基于 Apache Doris 内核,以实时、统一、弹性、开放为核心能力,在 ClickBench 全球排行榜多次登顶,支持 PB 级数据亚秒级查询,具备 AI 原生混合检索和 MCP Agent 接口能力。
SelectDB search():AI 日志搜索与分析场景的技术能力与实践
SelectDB技术团队
7 月 29 日
阅读 6 分钟
512
SelectDB(基于 Apache Doris 内核)通过内置 search() 函数在 OLAP 引擎内实现全文检索能力,支持 15 种查询算子、BM25 相关性打分、嵌套 JSON 搜索、跨字段检索。适用于 AI 日志场景中搜索与分析融合需求,整体存储成本较 Elasticsearch 方案降低 50%。
1
(current)
2
3
4
5
…
More
下一页
1
(current)
下一页