英伟达黄仁勋:若前沿实验室无法控制 AI,就必须关闭这些实验室
英伟达 CEO 黄仁勋在接受《纽约时报》采访时表示,如果前沿实验室无法控制其 AI 实验,那么"我们必须关闭这些实验室"。他针对 OpenAI、Anthropic、Meta 及 Google 等公司前沿模型的"越狱"攻击实体行为指出,AI 实验若产生失控智能体将引发民事与刑事责任,实验室需承担后果。他认为当前围绕前沿 AI 实验室的担忧属于"干扰",应聚焦实验可控性而非泛焦虑。
英伟达 CEO 黄仁勋在接受《纽约时报》采访时表示,如果前沿实验室无法控制其 AI 实验,那么"我们必须关闭这些实验室"。他针对 OpenAI、Anthropic、Meta 及 Google 等公司前沿模型的"越狱"攻击实体行为指出,AI 实验若产生失控智能体将引发民事与刑事责任,实验室需承担后果。他认为当前围绕前沿 AI 实验室的担忧属于"干扰",应聚焦实验可控性而非泛焦虑。
阿里 Qwen 团队提出 Qwen-Planner-Agent,一个连接数据生产、模型训练与部署的闭环 AI-for-AI 框架,用于可扩展地开发移动规划智能体。
研究者提出 IDQD-RDO,用输入相关的二次失真近似 MS-SSIM、LPIPS 等全参考图像质量指标,通过自动微分得到的 Hessian 矩阵-向量积估计其块对角或纯对角形式,使这类指标可逐块计算并用于 VVC 编码的率失真优化。在 Kodak 和 CLIC 上的五种指标测试中,该方法取得 14.2-36.7% 的 BD-rate 节省,无需改动解码器,编码复杂度仅增加 10-30%。
Runway 本月推出研究预览版 GWM Worlds 2,将高保真视频和音频生成变为实时交互模拟,以 720p、24 fps 连续视频和 48,000 Hz 音频流式输出,并新增 WorldPrompt 输入格式,可固定环境部分方面并通过带时间戳的事件控制角色、相机和场景。
Google Project Suncatcher 计划通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 TPU 在太空的运行表现。Trillium TPU 在 UC Davis 质子束测试中可承受超过五年太空任务总电离剂量的辐射;团队正用热管加辐射板方案解决真空散热,并计划 2027 年发射两颗卫星测试高带宽激光互联。
道彤投资入选创业邦「2026最受赞赏的早期投资机构50强」,并同时获评垂直领域榜「生物/医疗科技30强」。该评选由创业邦连续第六年推出,首次采用「同行评议」机制,由一线投资人评判机构的专业能力与行业声誉。
Meta 在 2026 年 Connect 大会上扩充 Horizon 平台,推出 Horizon Create 和 Horizon Studio 两款 AI 工具,支持创作者将提示词转化为完整 2D 或 3D 手机游戏。
谷歌宣布在上周推出的 Gemini 3.8 Live 基础上,正式推出带 Live Avatar 功能的 Gemini 3.8 Live,为实时对话模型带来接近实时的视觉形象。
马斯克在 X 平台回应网友时称,SpaceX 的 AI 研发只要保持强劲加速度,约 6 个月后将确立行业领跑地位。他表示 SpaceX 的 AI 研发才进行 3 年,而 Anthropic 和 OpenAI 已分别深耕 6 年与 10 年,并称 SpaceX 已展现出快速部署海量算力的工程交付能力。
Meta 推出无摄像头的雷朋音频眼镜,支持听音乐、打电话和与 Muse AI 智能体交谈,更轻、有两种款式,起售价 349 美元。扎克伯格在接受 Joanna Stern 采访时否认此举是对批评的回应,称该产品筹备多年,不可能因几个月前的争议仓促设计。
长安汽车在重庆辖区上市公司投资者网上集体接待日暨半年度业绩说明会上表示,力争 2028 年实现人形机器人量产、2030 年推出商用航线飞行汽车。其固态电池项目正有序推进研发,已开展 20Ah 氧聚复合固态电池验证。长安汽车布局机器人将先实现座舱、中控、扶手等汽车部件组件化,再走向覆盖搬运、物流、清洁、储能、补能等环节的智能出行生态机器人。
OpenRouter 核查后未发现任何 Seedance 模型的公开权重或模型许可。ByteDance 官方页面、ByteDance-Seed 的 GitHub 与 Hugging Face 组织均无 Seedance 检查点,GitHub 和 Hugging Face 上名为 Seedance 的项目只是 API 客户端或托管服务。
科学史研究者 benbreen 分享用 GPT-6 Sol、GPT-6 Astra 和 Opus 5.5 解决历史学开放问题的早期结果,包括用 GPT-6 Astra 识别出 Isaac Newton 从法文炼金术文本翻译成拉丁文的一段出处。
李佳琦对外媒表示,尽管 AI 正在重塑直播电商,这一领域未来依然离不开真人主播。华为余承东在合肥巡店时称,接下来将聚焦尊界、享界、智界、尚界,让每个界获得更充足资源,并首次回应问界品牌调整,称赛力斯主动提出想自己主导,华为表示支持。移动、电信、联通自 9 月 24 日起停止受理橙分期、沃分期、和包分期等新业务,“0 元购机”全面停办。
Meta 的个人 AI 智能体 Muse 被发现可在简单提示词下打包并返回用户虚拟机中的大量 Linux 文件,Peter James 和 Jonny L. Saunders 两名开发者已独立复现。
OpenAI 计划在未来几天内抢先预览网络安全专用模型 GPT-6 Cyber,并推出配套产品协助客户更安全、自动化地部署该模型。该模型及配套产品预计 9 月 29 日在旧金山 OpenAI 开发者大会上亮相,甚至可能更早,计划未来数月内正式上线,将是 OpenAI 今年发布的第四款网络安全专用模型。少数 Daybreak Red 计划客户已获得访问权限开展 Alpha 测试。
该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。
论文提出 G^2PTQ,一个在全局监督、逐块优化目标下同时整合一阶与二阶信息的统一 PTQ 框架,通过在量化每个 Transformer 块前刷新梯度与 Hessian 估计,避免以往全局方法的估计过时问题。
Wayfair 使用 OpenAI 模型改进电商客服与商品目录准确性,自动完成工单分类,并大规模优化数百万条商品属性。
针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。
研究者提出 softmax 重参数化,一种在量化前选取功能等价输出头的后训练方法,通过从每个输出行减去词汇行均值的标量倍数,并按验证 KL 分别为 RTN、激活加权 MSE 和 full-Hessian GPTQ 选择系数。
研究团队推出 AgentWorld,一个面向多智能体 LLM 长时程协作的基准,包含 100 个人工标注任务(另有 100 个增强变体),任务跨越 50+ 轮交互、需 3-20 个角色与能力不对称的智能体在 MMORPG 沙盒中协作。
研究者提出 PISA,一种采用金字塔 Top-K 选择策略的块稀疏注意力机制,通过构建 O(log N) 层级的键层次结构并逐层用 LogSumExp 打分筛选候选,将整体复杂度降至 O(Nlog N)。团队还开发了面向训练和推理的硬件感知 Triton kernel,无需物化 query-key 分数矩阵。在语言建模任务上,PISA 在常识推理等基准上与基线相当,并在检索任务上取得更好结果。
FuseReg 用随机编码器层子集训练替代启发式层融合,在 ImageNet-256 与 DINOv3-L 上,单个解码器无需重训即可从全层、稀疏和单层融合中重建,PSNR 高于固定融合的专用解码器。仅替换解码器即使未改动的 RAEv2 DiT-XL 生成器无引导 gFID 降低 27%,联合正则化两阶段在 DiT-Base 上降低 29%。
Kaggle 推出 Game Arena,一个通过竞技游戏评估 LLM 的开放平台,让模型在结构化环境中正面对战,游戏强度随模型进化自然提升,避免性能饱和。首批三个试点环境为国际象棋、扑克和狼人杀,覆盖完全信息、不完全信息与多人博弈场景,用于系统研究模型的策略规划、适应能力与不确定性下的鲁棒性。平台提供完整竞赛结果与评估指标,并保证可复现性与透明度。
InternW0-Δ 是一个统一的世界动作模型(WAM),在 Mixture-of-Transformers 框架下结合预训练视频专家、动作专家与冻结 VLM 的语义引导,并通过训练期蒸馏注入 4D 几何与运动先验。
Duplex-MPE 基准发布,用于评估全双工语音助手在多人共享对话中何时应答、保持沉默或停止说话,包含 2000 个由三到四名人类说话者与一名助手构成的场景,同一请求分显式与隐式指代配对。
研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。
针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。