DR.Cat (@o_cat) 在 deepseek v4.1正式推出~encoder-decoder架构文艺复兴引人注目 中发帖
DeepSeek V4.1 Flash:更强、更快、更普惠
分数
[0d68fbc08fd083f59581b433440d10e1]
[compressed_1789019798126]
模型开源链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash论文链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
架构解读
[6d3935cb7a46bad1e50402bf954fd46d]
这次用上的encoder-decoder是一个亮点
现在大语言模型基本上都decoder-only 上一个encoder-decoder的佳作还是Google T5(广泛作为文生图/视频模型的文本...