
腾讯混元 Hy4 调整底层架构:引入稀疏注意力与 IndexCache
腾讯混元 Hy4 preview 不仅扩大了模型规模,也对底层架构进行了较大调整。上一代 Hy3 采用传统全注意力机制,Hy4 则改为 Gated DSA,即 DeepSeek Sparse Attention 的门控版本。面对超长文本时,模型不再对前文全部内容重复计算,而是先筛选出最相关的部分进行重点处理。
Hy4 还在 DSA 基础上加入 IndexCache。过去模型每一层都需要重新判断哪些内容最重要,现在部分层可以复用前面已经筛选出的结果,从而减少重复计算。腾讯表示,这一设计受到 DeepSeek 和 GLM 启发。
另一项变化是残差结构。传统 Transformer 可粗略理解为只有一条信息主干,Hy4 通过 iHC 将其扩展为 4 条,使模型在更深的网络中保留更多信息。
MoE 结构也有所升级:专家数量从 Hy3 的 192 个增加到 256 个路由专家和 1 个共享专家。每个 Token 会选择 8 个路由专家,同时始终经过共享专家。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容