这几天,朋友圈和各个群都在刷同一个名字,GPT-6 Astra。
一句话生成 3D 火车,一台相机拆成 1877 个零件,特斯拉拆成 334 个部件,甚至有人拿它“拆人”,全身 2234 个建模部件挨个看。
还有更玄乎的,它自己打开浏览器,在 Canva 里一笔一笔给你画肖像,画了整整一个小时。OpenAI 员工让它弹《River Flows in You》,它自己搜到一个在线钢琴网站,鼠标当右手,键盘当左手,弹完还顺手录屏剪了条视频。
看完这些,很多人第一反应是,完了,3D 建模的学生天塌了,软件也不用学了。有网友的话说得最损,只要你学得慢,你就可以不用学。
笑归笑,咱们冷静聊聊这事。
先说结论,Astra 确实强,强得有道理,但现在刷屏的那些惊叹,大半打在了错误的地方。
就拿 3D 建模来说吧。很多人看到“一句话生成火车”就激动,觉得建模师要失业了。
可你细看过程,Astra 干的活儿,本质是写代码。
用 TypeScript 和 Three.js,一个参数一个参数把车身、车轮、几何结构写出来,再写动画代码让火车炸开又装回去。一台相机拆出 1877 个部件,跑了 3 个小时。
3 个小时。
人类熟手用专业软件干这个,未必更慢,质量还稳得多。
那意义在哪?意义在门槛。
以前你要碰 3D,得先啃几个月软件,界面复杂得跟飞机驾驶舱似的。现在门槛被铲平了,你张嘴说想法,AI 负责把想法落成结构。这是交互方式的变革,值得兴奋。
但要说商用?
直出的结果还粗糙得很,稳定性也是大问题,bug 终究得人来修。
拆特斯拉那个作者自己都承认,只是个框架级的粗拆,离真正的工程拆解差着十万八千里。
所以天没塌。塌的是“会用软件”这件事本身的含金量。
再说操作软件这个能力,我倒觉得这才是 Astra 真正吓人的地方。
以前 AI 再聪明,也是被关在笼子里的,只能输出文字和图片。
现在它能自己开浏览器,自己点 Canva 的工具栏,自己操作 Blender 重建旧金山艺术宫,把一张老蒸汽火车图纸变成 3295 个可编辑对象,甚至 600 个 Astra Agent 同时住进一个虚幻引擎的世界里。
这意味着什么?
意味着软件厂商过去花二十年修的护城河,也就是“人的学习成本”,一夜之间不算数了。以前每个软件都得专门做一个 AI 功能,Photoshop 加个 AI 填充,Excel 加个 AI 公式,缝缝补补。
现在思路直接反过来了,不用改造软件,让 AI 来用软件就行了。
为人类设计的每一个界面,从此都可能是 AI 的操作台。
这个转变,比生成几张酷炫的图深刻得多。当然,也得泼点冷水,那个画画案例跑到一半 Chrome 崩了,还得切换到另一种模式接着干。
一个小时的任务中间出状况,说明这套东西离“可靠”两个字,还有距离。
最让人心里咯噔一下的,是机器人那部分。
网友 Jay Chooi 把 Astra 接到了真的机械臂上,让它抓积木放进碗里。20 次尝试,成功率 95%。对照组的 Fable 5.1 只有 40%。
更关键的是,没做示范,没做微调,模型上来就会,术语叫 zero-shot。
前面那些再花哨,说白了都发生在屏幕里,翻车了大不了重来。机械臂不一样,它碰的是物理世界。屏幕里的错误可以撤销,现实里的错误是要留下痕迹的。
今天抓的是积木,明天呢?
Jay Chooi 挺乐观,说随着输出速度加快,大模型最早今年年底就能实时控制机械臂,最迟 2029 年。英伟达的前研究科学家 Yu Xiang 也出来表态,说机器人学的下一个前沿,就是怎么把这些先进模型真正接进物理世界。
你品品这个时间线。留给“AI 只会动嘴皮子”这个安慰的时间,真的不多了。
聊到这儿,那个被问了无数遍的问题就绕不开了,还要不要学?
我的看法可能跟主流不太一样。
大家都焦虑“学了白学”,我倒觉得真正贬值的,是“操作的熟练”,升值的是“判断的能力”。Astra 能拆 1877 个零件,但它不知道哪个零件值得拆,拆给谁看,拆了干什么。
它能弹琴,弹得节奏精准,可它不知道这首曲子为什么让人想哭。它能画你,画一小时,但画得像不像、好不好,最后还是得有双眼睛来拍板。
工具层面的事,正在被整体打包给 AI,这个趋势挡不住,焦虑也没用。
可目标、品味、对错,这三样东西还在人手里,而且随着执行成本暴跌,它们反而变得更贵。
当然,这话也有边界。
对那些正在学软件操作、指望靠手艺吃饭的年轻人,我说“别怕,判断力更重要”,多少有点站着说话不腰疼。他们的困境是真实的,转型期的阵痛也注定落在具体的人头上,就像当年每一轮技术革命一样。
道理是全社会的,代价是个人的。
