奥尔特曼:OpenAI 肯定会研发人形机器人
OpenAI 今年创立机器人部门,正在定制机电执行器、仿真流程和机器人数据采集等具身智能领域探索。CEO 奥尔特曼在《Sources Podcast》表示肯定会研发人形机器人,因为现实世界为人类设计;但形态并非最关键,机器人大脑才是核心。他认为人形机器人近期不会走入家庭,将先用于数据中心建设维护等工业领域,面向个人的通用机器人是长期目标。
OpenAI 今年创立机器人部门,正在定制机电执行器、仿真流程和机器人数据采集等具身智能领域探索。CEO 奥尔特曼在《Sources Podcast》表示肯定会研发人形机器人,因为现实世界为人类设计;但形态并非最关键,机器人大脑才是核心。他认为人形机器人近期不会走入家庭,将先用于数据中心建设维护等工业领域,面向个人的通用机器人是长期目标。
清华大学-美团数智生活联合研究中心学术论坛将于2026年9月21日13:30-17:30举行,主题为「物理世界的AI与大模型:挑战、路径与实践」,采用线上直播加清华线下形式,线下报名9月17日24:00截止,仅面向清华师生及其他高校教师和优秀在校生开放。
百度智能云具身智能前沿讲堂上,清华大学AIR助理教授赵昊与百度智能云AI计算首席科学家王雁鹏等对谈世界模型规模化问题。赵昊提出以3D/4D Token为核心的世界模型路线,认为世界模型不等于视频生成,需表达空间结构、光学属性和速度、加速度等动态信息;其OmniNWM通过动作编码与相机参数解耦,实现200帧稳定生成,并与精锋医疗、极智嘉分别合作手术预演和仓库机器人场景。
地平线宣布征程智驾芯片量产突破 1500 万套,自 2020 年前装量产以来从 0 到 1000 万用时 5 年,从 1000 万到 1500 万仅用时 12 个月,年增速 39%。芯片已累计赋能 800 万车主,与超 40 个品牌合作,累计获 500 款量产车型定点,在手定点总量超 2000 万套;《中国自动驾驶规模化应用蓝皮书》显示 2026 年上半年其全阶智驾芯片市场份额达 31.94%。
Rohan Paul 发帖称 HuggingFace/Pollen Robots 已从演示走向实际生产,深圳工人正在手工组装该机器人。
Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。
据《日经亚洲》报道,大阪大学森岛圭祐团队开发昆虫协同回路,AI 分析蟑螂心跳、神经信号和身体运动来判断环境并引导避险,在紫外线、化学物质和高温等五种环境测试中最高识别准确率达 93%,成果已发表于《Robomech Journal》。
Wayve 宣布携手 Uber 在伦敦推出英国首个有人值守 Robotaxi 服务,这也是 Wayve 的首次商业部署。首批 15 辆配备安全员的福特 Mustang Mach-E 将在除机场外的伦敦地域提供服务,车内交互式屏幕支持 64 种语言,乘客无需支付小费。
峰瑞资本发布与源络科技连文昭的对话,主题是机器人开始做实验与 AI for Science 的效率拐点。公开正文仅保留了导语式的一句话,未给出对话的具体观点和细节。
论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。
TechCrunch Disrupt 2026 推出新的 Real World AI 舞台,聚焦数字与物理世界的交汇及其持续融合的多种方式。标题提到舞台将包含 Nvidia、机器人与灭绝动物等元素,正文仅介绍该舞台的主题方向。
X Square Robot 发布 TwinDEX,一对协同设计的三指九自由度灵巧操作接口,一个可穿戴用于数据采集,一个用于机器人部署,两者共享相同的运动学、接触面、外观和传感器。
Apple Machine Learning Research 发布 REFACTOR-VLA 研究,针对 OpenVLA、π0、RT-2、RDT-1B 等当前视觉-语言-动作(VLA)模型生成原始动作的“单体式”结构,提出以无监督方式学习类型化运动程序库的方法。
World Labs(李飞飞联合创立)发布世界模型 Atlas,可从几张照片完成 3D 场景生成、重建与仿真,输出最高 1440p、1 分钟的可控镜头视频,并支持点云与 3D Gaussian splats 等 3D 数据输出。
据彭博社报道,优步将裁减约 3300 个岗位,占全球员工总数的 10%,管理层数量将减少 20%。公司压缩管理层级、收紧远程办公(未来仅约 1% 员工可远程),并将节省的资金投向网约车、配送和 Robotaxi 业务,计划未来几年向 Robotaxi 合作项目投入超过 100 亿美元。CEO 霍斯劳沙希在公告中未提 AI 对裁员的影响,但报道指出调整的另一原因是优步希望让 AI 更多参与日常运营。
由星源智与灵心巧手共同发起的“中国具身智能 Tier 1 产业联盟”于 9 月 2 日正式成立,联合奥比中光、法奥机器人、禾赛科技、速腾聚创、珞石机器人等 20 余家产业链企业。成员覆盖具身大脑、灵巧手、语音交互、激光雷达、视觉感知、触觉感知、机械臂、底盘、无线通信、热管理等关键环节。
具身机器人企业自变量 9 月 2 日发布孪生三指九自由度灵巧操作手 TwinDEX,其中一只可穿戴用于数据采集,另一只装在机器人上用于真机部署。官方评测显示其数据采集效率达真机遥操作的 5.3 倍,训练模型时无本体数据近乎可 100% 替代真机遥操作数据。
2026京东全球科技探索者大会将于9月9日在北京北人亦创国际会展中心召开。京东集团将在会上发布物理AI全景战略,行业大咖与技术专家将探讨技术前沿与产业实践。
VAST 近日宣布完成 B 轮及 B+ 轮融资。标题称其从 3000 万走到 30 亿,但正文未披露具体金额、投资方或资金用途等细节。
云启资本宣布参投瞬原科技种子+轮融资,称该公司以AI重构聚变研发范式。正文未提供更多交易金额或公司细节。
蓝鲸新闻报道闲鱼平台部分机器人租赁商篡改宇树机器狗电池标签,将原厂421.2Wh额定能量改为97.92Wh并伪造电压、充电限制等参数,以规避民航规定把电池带上飞机。改标服务加价约100至200元;按民航局规则超过160Wh的锂电池禁止携带或托运,宇树在售产品中仅Go1标准版133.2Wh可经批准携带。一位离职员工称2023年公司内部曾为部分客户粘贴低容量标签,宇树销售员表示标签可以改但无法提供。
X 用户 @BarryGoodStocks 分享的视频显示,量产版 Cybercab 在奥斯汀超级充电站通过中央触摸屏上的手动驾驶控制功能挪车,测试工程师长按屏幕方向按钮将车重新停入充电车位。
康诺思腾获得美敦力约7亿美元战略投资,双方将携手拓展手术机器人全球市场。文章提出的目标是让机器人辅助手术在全球范围内更加可及。
马斯克 9 月 1 日在 G20 创新部长级会议视频讲话中预测,未来 10 年内全球人形机器人数量将超过 10 亿台,每台产出至少是人类工作者的 5 倍,总生产力高于全球人类生产力总和。他还预测 AI 最快明年就能高效处理各类数字任务,将全球生产总值提升 20% 至 30%,即每年增加 20 万亿至 30 万亿美元。
宇树科技9月2日股价跌超4%,每股跌至550元以下,相比8月19日上市首日开盘最高1,100元/股已腰斩。该股发行价150.80元/股,开盘较发行价大涨629.44%,总市值一度达4,449亿元;2026上半年营收11.52亿元同比增长48.54%,扣非归母净利润2.44亿元同比下滑19.34%。
论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。
H3-World 提出一个把 33B MiniMax-H3 视频生成器转化为交互式世界模型的框架,通过自然语言指令实现精确的时间对齐世界控制。
论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。
YC 孵化的 Nori Robotics 推出面向开发的低成本类人机器人 Nori A3,售价 $1,688,2026 年秋季发货,在旧金山组装。硬件包括每臂 7+1 DOF、1.5kg 负载,12m 量程 Lidar,x4 720p RGB 摄像头,6-8 小时续航;配套 Nori Lab 笔记本应用可在家训练机器人并上传技能到 Skills Marketplace 共享。
地平线宣布征程 6M 迎来大规模量产上车里程碑,截至 2026 年 8 月底已落地 20 余家车企、70 余款量产上市车型,其中 7 家车企品牌基于该芯片实现城区辅助驾驶平台化上车。征程 6M 算力达 128TOPS,支持一段式端到端城区辅助驾驶,单颗芯片方案可支持风冷散热,满足燃油车的量产要求。
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。
马斯克表示 Tesla FSD 自动驾驶已经给用户带来巨大好处,并给出粗略估计:数字 AI 可能使全球经济增长 20% 到 30%,相当于每年约 20 万亿至 30 万亿美元。
Rohan Paul 视频点评一个双足机器人站在铺满滚珠的地面上仍能保持站立,认为其脚踝可能在每次滚珠滚动时发出微小力矩修正,避免把重量压到已开始滚动的脚上。
马斯克预测十年内全球将至少有十亿台人形机器人,每台产出至少是人类的五倍,总产出将超过全人类总和。该说法来自其受访言论,由 @cb_doge 转发并附视频。