老鸽 (@olddove) 在 【模型训练】MoE相关知识点汇总与讲解(下) 中发帖
引言与一些碎碎念
没想到我的文章有这么多人看( ,深受感动,于是快马加鞭的开始赶这一篇了,下一篇和下下篇的主题也差不多确定了,现在的我文思泉涌(bushi
说起来今天是八一建军节呢( ,祝大家节日快乐捏
昨天不知道为什么失眠了熬穿了,等我写完这篇就去睡觉……
这篇主要是讲解MoE相比于FFN,在模型训练时 FLOPs / 参数对比以及推理时的显存有哪些变化,这个是常错题(大概,以及目前常用的各类MoE变体以及他们独特的机制。昨天有佬友想让我讲解一下Kimi k3的MoE框架,这篇文章也会讲到。
最后还有一个题外话,也就是上一篇所讲到的 Temperature = 0 的情况下,为什么每次输出还会不一样?这与 MoE 的路由机制有很大的关系,也牵扯到我们这篇会谈的一个 MoE 变体:Soft MoE。
MoE FLOPs/参数量,推理显存相比FFN的变化
FLOPs与参数量
我们先...