LLM 预训练论文每日速览

每日自动抓取 HuggingFace Daily Papers · AI 筛选预训练相关工作 · 中文摘要

19预训练论文
307累计收录
2026-08-05最新日期
19 篇(仅预训练相关) · 已加载 12 更新于 2026-08-08 19:36
2026-08-05 1 篇

MameLoshnLM:意第绪语语言模型与评测基准

HF 热门 中相关 预训练数据continual/mid-training评测基准

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

判定:构建意第绪语预训练语料并继续预训练Llama 3.1 8B

针对意第绪语数字资源稀缺和评测缺失问题,作者构建了高质量预训练语料Oytser和多任务基准Kashes。基于该语料对Llama 3.1 8B进行继续预训练得到MameLoshnLM。该模型在基准上超越同规模开源基线,并更好捕捉意第绪语形态句法特征。

  • 发布高质量意第绪语预训练语料Oytser
  • 基于Llama 3.1 8B进行继续预训练得到MameLoshnLM
  • 构建Kashes基准验证低资源语言噪声数据缺陷
📄 2608.05850 ▲ 10 💬 2 📅 2026-08-05 ✍ Uri Katz 等 5 人
arXiv 原文 HF 页面 代码仓库
2026-08-04 2 篇

迈向多模态预训练的物理:知识流、模态协同、早期统一与配方

HF 热门 高相关 多模态预训练架构设计MoE

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

判定:系统研究多模态统一预训练机制与配方

本文研究原生统一多模态预训练中模态交互机制与设计空间这一未被充分探索的问题。通过在合成与真实数据集上的受控实验,系统分析了知识跨模态流动、协同与竞争、早期统一训练优势及高效配方。结果发现共享注意力等架构促进协同,早期统一优于晚期对齐,并以5%算力获得强生成性能,最终训练13.5B MoE模型于2T tokens验证。

  • 揭示语言与视觉间知识流的不对称转移模式
  • 共享注意力与模态特定FFN架构促进模态协同
  • 早期统一训练优于顺序训练并缓解视觉惰性
📄 2608.05000 ▲ 52 💬 2 📅 2026-08-04 ✍ Junlin Han 等 7 人
arXiv 原文 HF 页面

K-EXAONE 2.0 技术报告

HF 热门 高相关 MoE持续预训练长上下文

K-EXAONE 2.0 Technical Report

判定:报告涵盖持续预训练与mid-training及MoE架构升级

LG AI Research发布开放权重的多语言MoE基座模型K-EXAONE 2.0,通过对前代模型向上循环并扩展架构实现750B总参数、37B激活参数。训练流程结合持续预训练、难度聚焦的mid-training与后训练,支持256K上下文及十种语言。该模型在智能体编程与长上下文理解上提升明显,已Apache 2.0开源。

  • 由稠密模型向上循环为750B总参数MoE,激活37B
  • 训练含持续预训练与难度聚焦mid-training
  • 支持256K上下文并扩展至十种语言覆盖
📄 2608.04505 ▲ 16 💬 1 📅 2026-08-04 ✍ Eunbi Choi 等 77 人
arXiv 原文 HF 页面
2026-08-03 2 篇

LLaDA MoE v2:扩展混合专家扩散语言模型

HF 热门 高相关 MoEScaling Law架构设计

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

判定:系统研究MoE扩散语言模型预训练缩放规律并从零训练基座

本文研究混合专家扩散语言模型(MoE dLLM)的缩放行为,系统刻画其优化超参、算力分配与架构随规模的变化规律,发现与自回归模型存在定量差异。基于上述发现,从零训练了30B-A3B的LLaDA MoE v2基座模型,使用23.5T tokens预训练。该模型在仅经监督微调后,于多项推理与代码基准上接近或超越Qwen3等强基线,确立了MoE dLLM的实用缩放律与设计原则。

  • 揭示MoE扩散语言模型最优批大小、学习率与AR模型不同的缩放规律
  • IsoFLOP分析显示MoE dLLM最优token预算增长快于激活算力
  • 从零训练30B-A3B dLLM,少token量下逼近Qwen3并超越SDAR Chat
📄 2608.03457 ▲ 28 💬 2 📅 2026-08-03 ✍ Fengqi Zhu 等 14 人
arXiv 原文 HF 页面

当注意力失明:ALiBi位置编码中的数值失效问题

HF 热门 中相关 位置编码架构设计长上下文

When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings

判定:分析ALiBi位置编码缺陷及训练时缓解策略

本文揭示了ALiBi位置编码因线性偏置缩放下溢浮点精度,导致部分注意力头失明的失效模式。通过148M解码器预训练实验分析其影响,并评估四种训练时缓解策略。结果表明log缩放距离在passkey检索上最稳定,且默认ALiBi斜率仍是强基线,并给出训练建议。

  • ALiBi线性偏置下溢致注意力权重归零、头部部分失明
  • 148M解码器预训练实验区分该失效与上下文外退化
  • log缩放距离等训练时策略可缓解,默认ALiBi仍具竞争力
📄 2608.03994 ▲ 5 💬 2 📅 2026-08-03 ✍ Christopher Schröder 等 5 人
arXiv 原文 HF 页面
2026-07-29 3 篇

规模化记忆解码器:一种预训练的参数化长期记忆

HF 热门 高相关 预训练目标与算法训练系统模型架构

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

判定:从零预训练参数化长期记忆模块并规模化

针对解码器模型记忆与推理纠缠、难以独立扩展记忆容量的问题,本文提出规模化记忆解码器,将记忆模型扩展至6.9B参数并在300B token上预训练。为解决Faiss索引检索瓶颈,设计了分布式索引检索与稀疏批式kNN加载管线。实验表明独立扩展预训练记忆比单纯扩大基座更高效,6.9B记忆配Pythia-410M超越Pythia-12B且参数量少39%,Qwen3配域记忆平均提升超9分。

  • 提出规模化参数化长期记忆模块并从零预训练
  • 设计分布式Faiss索引与稀疏批式kNN加载解决吞吐瓶颈
  • 独立扩展预训练记忆比扩大基座模型更具参数效率
📄 2607.27919 ▲ 51 💬 2 📅 2026-07-29 ✍ Rubin Wei 等 7 人
arXiv 原文 HF 页面 代码仓库

Chimera:设计与Chinchilla式缩放的混合视觉扩散Transformer

HF 热门 中相关 架构设计Scaling LawMoE

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

判定:视觉扩散Transformer的架构与Scaling Law预训练方法

针对高分辨率图像与长视频生成中全注意力二次复杂度问题,提出Chimera混合视觉扩散骨干,融合KDA、MLA与MoE并设计HeteroP超参迁移方案。基于Chinchilla式计算最优律拟合激活参量、训练token与图文视频配比,训练11B总参/2B激活模型。实验表明其预训练扩散损失计算效率达基线7.3倍,且可零样本外推至30秒视频。

  • 提出KDA+MLA+MoE混合架构消除位置编码并实现线性复杂度长上下文
  • HeteroP模块级超参迁移支撑异构架构的Chinchilla式计算最优缩放
  • 实测预训练扩散损失效率7.3倍且零样本视频时长外推至30秒
📄 2607.28611 ▲ 17 💬 1 📅 2026-07-29 ✍ Chongjian Ge 等 12 人
arXiv 原文 HF 页面

超越几何互补性:稀疏混合专家路由中的相干重叠

HF 热门 中相关 MoE架构设计

Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing

判定:分析MoE路由几何特性,涉及预训练架构与训练

该论文研究稀疏MoE语言模型中专家路由的几何与功能关系,指出共选专家存在显著子空间重叠但路由仍具价值。作者提出ESSI指标与受控因子实验,分离路由相干性、候选质量与上下文交互。结果表明实际路由优于匹配替代,且多专家计算在冻结路由下仍提升下一词预测,定义为“相干重叠”。

  • 区分路由相干性、候选质量与上下文交互三类量
  • 跨六类MoE证实专家子空间重叠但实际路由更优
  • 冻结路由下加专家仍改善预测,称相干重叠现象
📄 2607.28308 ▲ 4 💬 2 📅 2026-07-29 ✍ Huiyuan Tian 等 3 人
arXiv 原文 HF 页面
2026-07-28 3 篇

Metis:记忆基础模型

HF 热门 中相关 架构设计预训练数据mid-training

Metis: Memory Foundation Model

判定:涉及mid-training与训练数据构建,对预训练有借鉴

该论文旨在为基座模型赋予原生记忆能力,弥补外部记忆模块的不足。提出Metis架构,在主干中引入持久演化的记忆状态,并通过大规模记忆专用训练数据与多目标在mid-training阶段习得记忆过程。推理时权重冻结、记忆状态经前向自主更新,实验显示其具备原生记忆能力并开源了模型。

  • 提出原生记忆状态与记忆过程的形式化定义
  • 通过mid-training与专用数据习得记忆能力
  • 推理时梯度无关仅前向更新记忆状态
📄 2607.26760 ▲ 261 💬 3 📅 2026-07-28 ✍ Zeyu Zhang 等 17 人
arXiv 原文 HF 页面 代码仓库

探索式建模:解锁第三预训练轴与端到端生成

HF 热门 高相关 预训练目标与算法训练动力学Scaling Law

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

判定:提出探索建模作为生成模型第三预训练轴并端到端训练

该工作指出生成模型尚未端到端训练,因多模态分布难以直接建模。提出Explorative Modeling(XM),通过分解训练循环、探索K个候选匹配并选最优训练,使预测提交到具体模式。XM在图像、视频、语言上随探索规模提升性能,提升FLOP效率4.1倍等,并支持端到端重建生成,推理步数大幅减少。

  • 提出Explorative Modeling新范式,分解训练循环而非生成过程
  • 探索规模成为参数与数据外的第三预训练轴,随规模增益增大
  • XM支持端到端生成建模,在多项任务显著提升效率与性能
📄 2607.27372 ▲ 13 💬 2 📅 2026-07-28 ✍ Alexi Gladstone 等 3 人
arXiv 原文 HF 页面 代码仓库

宪法式中间训练:内容呈现驱动对齐增益

HF 热门 中相关 continual/mid-training预训练数据课程学习

Constitutional Midtraining: Content Presence Drives Alignment Gains

判定:涉及mid-training阶段插入内容,属预训练延续

该研究探讨在中间训练(midtraining)阶段插入基于原则的价值观内容能否产生持久对齐。方法是在120B规模上以宪法语料进行中间训练,采用2x2因子设计对比重放控制组。结果显示宪法式中间训练提升对齐泛化与耐久性,且在黑mail等场景优势可存活良性微调,且不损能力。

  • 在midtraining隔离插入宪法内容验证持久对齐
  • 120B规模2x2实验显示内容存在比结构更重要
  • 宪法中间训练抗黑mail倾向且不影响基准能力
📄 2607.26654 ▲ 6 💬 2 📅 2026-07-28 ✍ Desiree Cho 等 7 人
arXiv 原文 HF 页面 代码仓库
2026-07-26 1 篇

Kimi K3:开放的前沿智能

HF 热门 高相关 MoE架构设计Scaling Law

Kimi K3: Open Frontier Intelligence

判定:从零训练MoE基座模型并报告架构与训练配方

Kimi K3是一个2.8T参数的MoE基座模型,激活104B参数,具备原生视觉与百万token上下文。其采用Kimi Delta Attention、Attention Residuals与Stable LatentMoE等架构创新及精炼数据配方,较K2提升约2.5倍缩放效率。经后训练与基础设施协同设计,在长程编码、智能体、推理与视觉等任务达前沿水平并开源权重。

  • 2.8T MoE基座模型,104B激活参数,原生视觉与百万上下文
  • Delta Attention与Stable LatentMoE提升信息流与缩放效率2.5倍
  • 算法系统协同与专家并行支撑训练,开源全量权重
📄 2607.24653 ▲ 423 💬 9 📅 2026-07-26 ✍ Kimi Team 等 402 人
arXiv 原文 HF 页面 代码仓库