LingEasy 在 现在模型评测方面的问题,感觉完全没有评测大项目完善修改,都是在测试能否完成一个小项目 中发帖
现在模型评测方面的问题,感觉完全没有评测大项目完善修改,都是在测试能否完成一个小项目
因为发现很多模型,现在让你完成一句话实现一个网站、实现一个svg、实现一个任务
包括测评雷达等 都是在依赖一些一次性任务判断一次性能否产生正确结果的测试。
而真正大部分使用模型的人在做的是,对一个现有代码仓库进行修复、新增功能、扩展。
尤其对于大型项目的时候,模型能力差异巨大。
前期可能很高分的模型并不好用。
这点有没有比较权威的测试评分?