@listeningHy4 preview 简易测评 (toyamanao) 中发帖

利益相关:toyamanao 现供职于腾讯混元团队 
短的结论:鹅家有女初长成
基本情况:在模型研发大加速的背景下,头部厂商已经把模型发布间隔压进了两个月乃至一个半月,这背后是整个模型生产管线的高速运转。而经过 Hy3 锤炼的混元团队也敏捷起来,Hy4 preview 距离上次发布也仅有 7 周。但间隔短不意味着模型提升小,换代之后的Hy4 preview 规模也来到了可攻可守的“舒适区”,这个参数量可以塞下比前 300B 更大的知识空间,Agent 能力经过良好调教也可以与更大 Size 的模型相媲美。就逻辑能力来看,Hy4 preview 基本持平发布早 10 天的同尺寸 GLM-5.3,推理效率差一些,但在更低的定价下,任务成本依然占优。而 Agent 能力同样持平 GLM-5.3,在不同任务领域互有胜负。
成绩数据:之前在 Hy3 评测中,**笔者曾申明今后混元的成绩不会进榜。...