
在OpenAI的GPT-3开启基础模型时代之前,公司从零开始构建专门的自然语言处理模型,每个模型都在大量特定任务的数据上进行训练。如今,大多数组织从OpenAI的GPT系列、Claude或Llama等通用模型开始,然后对其进行微调或提示,以解决其特定需求。
认为具身AI将遵循类似的模式。与其收集庞大的现实世界数据集来构建专门的机器人模型,他认为行业应该专注于更高质量的数据集,这些数据集能够生成基础模型,从而在许多环境中转移关于运动和互动的直觉。
“现在很多公司都在进行大量专注于个别实体、个别环境和个别机器人的专业化工作,”德维特告诉TechCrunch。
他争辩说,随着像General Intuition正在开发和部署的通用模型这样的模型的出现,其中许多工作将很快变得多余。
“模型本身的泛化就是产品,”他说。“它对空间和时间具有基本的推理能力,这将是人们停止收集数十万或数百万小时真实世界数据的原因。因为实际上,你只需要几分钟。”
General Intuition 在训练了数百万小时的电子游戏数据后,建立了自己的基础模型,这些数据包括人类在何时按下控制器上的哪些按钮等信息。de Witte 和 General Intuition 的主要投资者 Vinod Khosla 都认为,动作数据是开发人类般的空间时间推理直觉的关键。
基于该论文的估值。该公司已经证明,其当前模型既能连续玩数小时的视频游戏,也能在仅用八分钟的真实机器人数据微调后为四足机器人提供动力。
德维特说:“事实上,[机器人]仅凭前置摄像头,没有其他传感器,就能在办公室中应对动态物体的引入和人们走动的情况,这让我们非常惊讶。”“我认为这是一个预示着未来趋势的迹象。”
General Intuition 的最终目标不是自己制造机器人,而是成为物理人工智能的基础模型,为其他机器人公司提供一个构建自己机器人的基础模型。或者正如 de Witte 所说:“我们不会建立一家自动驾驶汽车公司。我们将使下一个人建立自动驾驶汽车公司变得容易10倍。”