SIGMOD是数据库领域的顶尖学术会议,由中国计算机学会(CCF)推荐为A类会议。第52届SIGMOD年会于2026年5月31日在印度班加罗尔召开,汇聚全球顶尖学者与业界专家,共同探讨数据科学的最新前沿。
以下是北大数据所SIGMOD 2026论文的简要介绍:
[1]. Hydraulis:通过协同设计并行策略与数据分配实现大模型训练负载均衡

论文名:Hydraulis: Balancing Large Transformer Model Training via Co-designing Parallel Strategies and Data Assignment
在大规模Transformer模型训练中,输入序列往往存在显著的长度差异。目前,主流的训练系统通常采用两类方法:一方面,并行策略上采用静态、同构的配置,即所有训练流水线在整个训练过程中都保持相同的并行度组合;另一方面,数据管理上使用固定长度packing,即先设定一个最大序列长度,再将不同长度的原始序列packing成不超过该阈值的长序列,并平均分配到各设备上。这种“静态同构并行+最大长度packing”的组合在实现上简洁,但却存在迭代内与迭代间采样不均、流水线内与流水线间packing不均这些负载不均现象。
核心创新:
1. 动态异构并行策略:针对采样不均衡,Hydraulis支持在不同迭代动态选择合适的并行策略;在同一迭代内,不同流水线可采用异构并行配置(如tensor/pipeline/context parallel度数不同),使长短序列各自匹配最优方案,从而同时缓解intra-iteration与inter-iteration的不均衡。
2. 优化—传播解耦与子图机制:Hydraulis 通过将传播阶段(前向/反向计算)与优化阶段(梯度同步与更新)解耦,保持优化阶段的参数分片固定不变,同时允许传播阶段灵活切换异构并行配置。为进一步解决两者之间的异构通信问题,我们引入了 pull(拉取参数)和 push(同步梯度)操作。基于子图抽象,我们进一步统一表达了不同并行策略下的通信模式,实现了异构并行策略之间的无缝切换。
3. 两阶段序列分配:针对packing不均衡,Hydraulis先在流水线间分配原始序列以保证负载均衡(解决inter-pipeline imbalance),再在流水线内部通过基于整数线性规划的优化方法进行packing,使不同微批次的执行时间更加接近(解决intra-pipeline imbalance)。
4. 数据分布感知的策略候选生成:结合数据集的全局序列长度分布,Hydraulis使用动态规划生成一组高质量的候选策略,训练时快速评估与选择,避免了迭代中穷举搜索的开销。
实验效果: 在LLaMA2 7B、13B和32B模型上,以CommonCrawl和GitHub两个大规模数据集为基准,我们在64张Nvidia A800 GPU的集群中开展实验。结果显示,Hydraulis相较于Megatron-LM、DeepSpeed和HotSPa,在端到端性能上提升1.32–2.66倍。进一步实验表明,在 GPU 数量扩展、最大序列长度增大和batch size调整等不同条件下,Hydraulis均展现出良好的扩展性和稳定性。
该论文作者包含李昊洋(北京大学,导师为崔斌教授)、符芳诚(上海交通大学,通讯作者)、林晟(北京大学)、葛浩(北京大学)、王煊宇(北京大学)、牛佳文(北京大学)、薛金宝(腾讯)、陶阳禹(腾讯)、王迪(腾讯)、蒋杰(腾讯)、崔斌(北京大学,通讯作者)
参会照片:
|
|
|
|
|
|
[2]. SSCard:面向子串查询优化的误差有界基数估计方法
论文名:SSCard: Substring Cardinality Estimation using Suffix Tree-Guided Learned FM-Index

在数据库查询优化中,基数估计直接影响执行计划的选择。对于 SQL LIKE '%pattern%' 这类子串查询,现有传统方法往往依赖独立性假设,面对长模式或复杂文本分布时误差较大;学习型方法虽然具备建模能力,但通常缺乏明确误差界,可能导致不稳定的估计结果。
为此,本文提出 SSCard,一个面向子串查询的基数估计器。SSCard 将 FM-Index 扩展到数据库多字符串场景,并结合剪枝后缀树和误差有界的学习表示,在准确性、空间效率和稳定性之间取得平衡。
核心创新:
- 多字符串 FM-Index 扩展:针对数据库文本列由大量不同长度字符串组成的特点,SSCard 设计了适用于多字符串集合的 BWT 构造方式,使 FM-Index 能够自然支持数据库子串查询。
- 剪枝后缀树引导的索引组织:SSCard 使用剪枝后缀树组织索引结构,既能对短模式提供精确估计,又能为长模式估计提供高效的层次化结构。
- Pushup 空间压缩机制:针对大字符集和偏斜字符分布下的空间开销问题,SSCard 将低频字符信息向高层节点合并,减少重复存储,提高索引压缩效率。
- 误差有界的学习表示:SSCard 使用样条插值表示 FM-Index 中的 Rank 信息,并引入显式误差界,使估计结果比普通学习型方法更加稳定、可控。
- 双向估计与增量更新:SSCard 结合后缀树的精确匹配能力和 FM-Index 的任意长度模式支持能力,实现高效子串基数估计,并支持数据动态更新。
实验效果:在 5 个真实数据集上,SSCard 优于传统方法和近期学习型方法。相比第二优方法,SSCard 平均 q-error 降低约 20%,最大 q-error 降低约 80%,构建时间降低约 50%。
该论文作者包含詹宜瑞(北京大学,导师为高军教授)、聂文(华为技术有限公司)、高军(北京大学,通讯作者)。

论文名:Divo: Learning a Stable and Effective Query Optimizer with a Diverse Workload
在数据库查询优化领域,基于学习的查询优化器(LQO)近年来展现出超越传统方法的潜力,然而在面对多样化查询负载时,现有 LQO 普遍出现严重的性能退化,难以在真实场景中稳定部署。为此,本文提出 Divo,一个面向多样化负载、兼顾稳定性和高效性的学习型查询优化器,通过查询生成、训练策略与损失函数三个层面的协同设计,系统性地解决了 LQO 在多样化负载下的性能瓶颈。
核心创新:
1. 模板演化式查询生成器:在保留真实负载连接关系的前提下系统性地演化出新的模板结构,配合加权采样策略确保生成查询的多样性与保真度,为模型提供充分且多样的训练数据。
2. 基于静态经验的两阶段训练框架:提出先收集后训练的两阶段范式。第一阶段从多样化查询中预先收集完整执行计划形成"静态经验池",避免知识过时导致性能污染;第二阶段通过参数共享架构将静态经验用于增强训练,一次收集即可适配多种训练配置。
3. 多样性感知的概率分布损失函数:以 KL 散度损失补充传统 MSE 损失,将延迟预测转化为对延迟概率分布的预测任务,通过类别标签消除延迟量级差异导致的拟合问题,并以概率分布自然容忍不一致的真实延迟标签,显著提升 RL 训练的稳定性。
实验效果: 在涵盖 JOB、DSB、Extended JOB、Stack 及生成查询的混合负载上,采用训练/测试模板完全不重叠的挑战性划分,Divo 相对 PostgreSQL 实现了 1.3× 的总执行延迟加速,平均优于六种现有 LQO 达 14.9 倍。在动态负载切换等更复杂场景下,Divo 同样展现出稳定的性能优势。
该论文作者包含陈天异(北京大学,导师为高军教授)、高军(北京大学,通讯作者),屠要峰(中兴通讯,通讯作者)林阳 (中兴通讯) 徐墨 (中兴通讯)韩银俊 (中兴通讯)


班加罗尔SIGMOD-26 数据所论文简要介绍




