歌颂codex、飞书cli、chrome集成。因为我让所有开发人员的信息呈现形式都是走框架图,是飞书里的画板。图很大,查看起来要四处拖动和缩放,而且不单纯是标准代码语言插入的流程图,文字信息也无法暴露到网页层。本来对codex操作这个大框架图没抱太大期望。
但codex的computer use+飞书cli操作的精细程度 竟然能查看和修改这么复杂这么大的框架图!而且“文字信息也无法暴露到网页层”是它尝试并确认了的,而它插入新的框架图又会想到“用标准代码语言插入”,我本来还想说要不要提示它用mermaid或者plantUML,心想算了让它自由发挥吧,它也确实自己能想到。
我靠!太智能了太精细了!
这里大概形成了这样的分工:→能从网页结构中读取的,优先走网页语义;→需要飞书原生能力的,走飞书 cli;→网页结构拿不到、但肉眼可见的,走 computer use;→需要插入标准流程图的,先生成 mermaid/plantUML,再通过 cli写入;→写完以后,再回到 chrome 中从最终用户视角验收。
各方力量:→codex:理解目标、探索能力边界、判断该走cli还是视觉操作、生成内容,根据结果继续修正→飞书cli:把自然语言意图转成可执行的飞书操作;负责授权、定位文档/画板、读取或导出、用 中间语言更新画板→chrome 集成:提供已经登录的飞书会话、当前标签页和真实网页现场,省掉重新登录,也让 codex 能继续操作正在看的页面
数学的技术笔记
