Rhysliu 在 Qwen3.8-Flash:全新架构,更强更稳更划算 中发帖
Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。
昨天是怎么了,显示glm-flah ,晚上又看到这个! 国模起飞~