@wilsons大模型能力到底怎么样?自己测(Qwen-3.8-Max超预期) 中发帖

中等难度版
测试题目和答案:
100题-中等版-题目和答案.zip (55.2 KB)
提示词:
请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。

本测试集是一套用于评估大语言模型综合能力的中等难度测试题集,共包含 100 道题目。题目均选自公开的官方 Benchmark,不自行编写题目,尽可能保证测试内容具有可追溯性、客观性和不同模型之间的可比较性。
整套测试由四个部分组成:




测试集
题数
占比
主要测试能力




BigCodeBench
40
40%
代码生成、API/第三方库使用、数据处理、文件操作等综合编程能力


CRUXEval
20
20%
Python 代码理解、程序执行过程分析、精确输出预测


LiveBench Math
20
20%
数学推理...