LLMcoder (@kevin210) 在 Ollma Cloud 也上glm-5.3-flash了,量给的还可以。 中发帖
ollama cloud今天上的glm-5.3-flash, 测试了一下,速度没问题,用量还可以,默认思考强度的时候5h用量能到2000次请求, 后来开了max强度之后,5h也能到1300次请求。 我的平均上下文长度在60k左右。但是统计用量的时候发现ollama cloud可能是不带cache的,所以每次提交上下文长度要控制住,这是提升ollama用量的关键。
[image]
[image]