你有没有发现,用ChatGPT在手机上订个机票,得来回聊十几轮?AI明明能思考,但每次操作都得靠你手动点。问题出在哪?出在它和界面之间那个“哑巴”层。Google最近开源了一个叫A2UI的协议,不声不响,却可能彻底改变这事儿。
说白了,现在所有AI应用,不管多智能,最后给你的都是一个对话框。你想改个参数,它只能打字描述:“请点击右上角设置”。你得自己去找。要是让AI直接生成一个设置界面呢?风险太大,代码可能夹带私货,谁敢用?
A2UI的解法很反直觉:AI不再生成任何可执行的代码,只输出一份JSON“蓝图”。蓝图里写清楚:“这里放一个日期选择器,那里放一个提交按钮”。至于这按钮长什么样,是圆的方的,在哪端运行,客户端自己决定。

你琢磨一下,这就像UI界的“通用语”。AI只负责说“我要表达什么”,客户端负责“怎么画出来”。两边各干各的,彻底解耦。以前前端工程师得为AI写死模板,AI只能往模板里填数据。现在AI可以动态组合界面,像搭积木一样。
而且安全这块,A2UI把信任边界画得死死的。客户端提前注册一个“白名单”,所有能用的组件都得在这名单里。AI输出的JSON只能引用这些组件,想塞一段自定义代码?门都没有。这就相当于,AI说的话变成了“配置数据”,不再是“可执行指令”。企业级场景里,这个设计太关键了。
更厉害的是,它不只是静态展示。A2UI定义了完整的交互闭环:AI输出蓝图,用户操作,事件回传,AI再根据结果更新蓝图。整个过程可以流式渲染,AI边想边输出,客户端边解析边刷新。用户不用等完整响应,就像看直播一样。

打个比方,以前你让AI帮你订酒店,它得一步步问你:“哪天入住?住几晚?预算多少?”你答一句它回一句。现在呢?AI直接甩给你一个表单,你填完点提交,它后台处理,然后实时更新出一个确认页面。你不再是“操作员”,而是“监督者”。AI成了流程的第一作者。
这其实是对“谁主导人机交互”的一次重新定义。过去人类发起指令,AI被动响应。未来AI主动构建任务界面,人类负责决策和确认。交互模式从“对话中心”变成了“任务中心”。
当然,这个协议还没成为标准。OpenAI、微软会不会推自己的方案?组件库会不会像npm一样爆发?AI动态生成的界面,怎么保证无障碍设计?怎么防止它故意诱导你点“同意”?这些都是挑战。

但至少,Google走出了第一步。它用一份开源协议告诉所有人:AI不该只是会聊天的鹦鹉,它应该能“动手”帮你干活。界面,就是它最好的手。
这事儿你怎么看?你觉得AI能学会“画界面”这件事,还是说最后还得靠人自己点?评论区聊聊你的想法。