红烧白开水 (@Tinkless)分享一套在Windows上的codex使用computer use的优化方案 中发帖

这套方案是在x上刷到的,和ChatGPT沟通了下,了解到Windows本身自带就有cu(后续用cu代表computer use),但只支持系统的和部分应用,无法兼顾复杂的生产环境,然后就做了一套mcp和cu协作的方案:一套「原生执行层 + 视觉兜底」优化方案 
前言
在 Windows 上使用 Codex 的 Computer Use 做桌面自动化时,一个很明显的问题是:
它能操作,但很多时候不够快。
哪怕只是:

点击一个按钮
输入一段文字
切换一个设置
重命名一个文件

都可能经历多次:
截图 → 上传 → 模型识别 → 决策 → 执行动作 → 再截图 → 再判断
真正拖慢体验的,往往不是鼠标移动,也不是 Windows 本身响应慢,而是:

模型为了完成一个简单动作,需要反复“看屏幕、思考、验证”。

于是我尝试了一条完全不同的路线:

Codex 继续负责理解任务...