@MauveNaghtshadedeepseek v4.1f 预览版(0910)IOL 语奥测试:进步较大! 中发帖

书接上回,我提出用 IOL 语言学奥赛题目测试大模型能力。 


今天突然爆出 DeepSeek 出了预览版:大家直接 /model deepseek-v4.1-flash-expires-on-0910 就能用。于是我抓紧来测试一下它的 IOL 能力。
评测结论是:进步较大,回答基本是 “略有瑕疵” 水平,显著优于旧版本,不会在语法框架上犯大错误了。但距离 GPT-5.6-Sol 等轻松得到满分的模型,尚有差距。基于这一测试得到的推论(叠甲:不表示一般结论)是,v4.1f 在逻辑推理、信息归纳和理论一致性能力上有显著进步,可以作为工程辅助模型。
接下来是具体分析。
首先测试的是 2023IOL第二题 ,此前我拿 v4f 和 v4p 跑过测试,正好作为对比。v4.1f的作答基本正确,没有再犯 v4 时代的 nhinhikary vs. nhixinhikary 的注意力错误,没有像 ...