叅 (@Timmyzzo)简单做了个search能力的小测试题【图一乐】,grok4.5 4.2 gpt 5.6 sol网页版和codex,claude系列测不起 中发帖

grok-4.20-multi-agent-xhigh可用性变低后,grok忘记了搜索和nsfw的老本行了,开始进军code,所以评鉴一下最近一代的search能力
测试结果就不放了太长了,放个prompt吧
prompt:

prompt
[image]
模型A:grok build 原生调用 4.5 high
模型B:web 5.6 sol 高
模型C:grok web super 4.5 expert
模型D:个人grok2api 的 grok-4.20-multi-agent-xhigh
模型E:站里某大佬的官key:grok-4.20-multi-agent-xhigh
模型F:codex 5.6 sol xhigh (居然跑了一个多小时。。。)
模型G:Gemini 3.1pro web
结论排行(由codex 5.6 xhigh提供):




排名
...