对 AI 终极形态的设想

对 AI 终极形态的设想

18 views

我对 AI 终极形态早在两年前就有过设想, 但终有一步没想明白, 刚才洗完澡吹头发的时候突然想到一个绝妙的思路, 遂整理成文.

人类看到的不是截图,而是视频流

想一想你是怎样操作电脑的:首先是眼睛看着屏幕。

第一个问题无比关键——你看到的是什么:A. 一系列连续的帧;B. 视频流。

如果说是前者,那当下的 computer use 确实是这么做的。下面是 Claude computer use tool 官网给出的方案。

但是这个思路对吗?

显然不对。

如果你在玩网络游戏,或者浏览动画比较丰富的网页,一顿静态截图一定会丢失信息。

image.png

所以你眼睛里看到的是视频流,然后视频流传输到你的脑子里。脑子就是 AI,负责解析看到的东西,然后决策下一步:也许是用鼠标往下滚动,也许是把鼠标移动到某个地方,用键盘输入些什么……

假设这个流程处理的任务不复杂,那么从你的眼睛看到视频流,到大脑处理下一步动作,再把指令传输给你的手或其他器官,速度是极快的。

截图 → 上传 → 下载 → 解析,真的太慢了

显然,当下 AI 是做不到的。

先不谈视频流,哪怕是 screenshot,截图 → 上传 → 下载 → AI 解析 → 给予指令,这一套组合拳下去,估摸得一分钟出去了。

而这个操作人需要多久?

各位自己品。

所以我认为,既然通过截图的方式已经很慢了,那么当下 computer use 都不应该在这个方向花费太多时间,直接就把精力放在视频流上。

FSD 已经证明了这条路是可行的

该技术并不是没有先例,首先应该想到的就是特斯拉的 FSD:摄像头获取纯视觉视频流,AI 中枢实时态势感知,然后下发指令操作实体机械。

这个过程同样要求快准狠,汽车高速行驶不可能给你时间慢慢吞吞地截图。

当然,截图的方式也不是没有意义,在一些速度要求不高的场景还是有一席之地,比如交叉路口的电子眼、小区地下车库的抬杆装置。

FSD 之所以做到这一点,是因为车机就自带一台 AI 中枢,视频流的传输读取、AI 的推理、指导实体机械,全都缩在这一个车内,所以数据传输不会成为瓶颈。

当然,光通信技术的升级、芯片技术的升级,都会让这些更快。

本地部署解决不了,社区部署呢?

这就引出一个常见的话题:本地部署。

但我认为,现在、未来,对于通用大模型,不可能做到本地部署,差距太大,就是 PC 跟数据中心那种级别的差距。

但只要是有数据中心,必然就存在数据传输慢的问题。

这个问题困扰我了两年,直到刚才吹头发的时候,突然想到:AI 数据中心是不是可以像特斯拉的充电桩、5G 基站一样,一个社区部署一个实例?

然后这个社区的人访问起来,是否就能像在特斯拉的车里享受 FSD 一样的速度?

如果 AI 真的是第四次工业革命

当然,这些都是理论猜想,实际成本不用想都是惊天大爆炸。

但如果你把 AI 看成第四次工业革命,也许在未来某一天是有可能的。

那么后续无论是下达代码指令操作电脑,还是实际操作具身机器人,这个速度都会惊人的提升,直到和人类抹平。

Computer Use 的终点,应该是模拟人类

最后说一下 computer use。

我觉得 AI 下达操作的代码不应该复杂,比如不要有 .scroll() 这样命令式的指令。

因为人去滑动鼠标,绝不是脑子里下达指令,让人的手去执行 .scroll() 的函数。

指令尽可能模拟人类最朴素的操作鼠标、键盘的方式,这些能力后面具身机器人做出来,也可以复用。