Nuanced 作者复盘:计划模式为何已死
作者复盘其围绕规划构建的桌面编码应用 Nuanced 的失败,认为计划模式正变得不再有用。模型理解大型代码库的能力提升,使显式指令和 AI 生成的规格文档价值下降;而规划与构建应交织进行,Codex 等工具正在让计划与执行的边界消融。人类如何在数百个并行智能体快速修改系统时保持连贯的心智模型,仍是未解决的问题。
作者复盘其围绕规划构建的桌面编码应用 Nuanced 的失败,认为计划模式正变得不再有用。模型理解大型代码库的能力提升,使显式指令和 AI 生成的规格文档价值下降;而规划与构建应交织进行,Codex 等工具正在让计划与执行的边界消融。人类如何在数百个并行智能体快速修改系统时保持连贯的心智模型,仍是未解决的问题。
华为终端 BG CEO 何刚透露,未来一段时间将发布一款血糖测试设备,相关技术研究总共做了四年,才拿出可接受、可产业化的技术。他在北京大学 2027 届华为应届生招聘宣讲会上回应学生提问时表示,华为看重中长期价值和贡献,不急于每年产出。此前 2023 年 5 月,余承东曾宣布华为 WATCH 4 系列首发支持高血糖风险评估研究。
谷歌为 Pixel Watch 3/4/5 推送健康功能更新,新增血压趋势、睡眠呼吸和胰岛素抵抗趋势监测,血压与胰岛素抵抗功能基于长期数据分析,每月提供一次评估结果,不替代专业医疗检测。
微软 CEO 萨蒂亚·纳德拉表示,正在将 Copilot 打造成一个全新的工作操作系统,适用于所有模型、所有工作场景和所有任务。此前微软发布了新版 Copilot“超级应用”,将聊天、编程和智能体三类 AI 能力集中到同一界面,定位为“为工作而生的 AI”。
MIT 校内人士发文讽刺校园大规模安装 AI 监控摄像头:Building 1 每层已有 6-7 个摄像头,全校超过 500 个,MIT 正探索接入 Ambient.ai 的 AI 能力,并在 2026 年 5 月教师会议上承认未经知情同意已在校园测试 AI 功能。
上汽集团与华为终端深化尚界品牌协同,上汽追加 10 亿元投资对金桥尚界专属工厂进行智能化升级改造。2026 年 1 至 8 月尚界累计批售超 5 万辆,经销商近 1000 家、渠道覆盖率达 75%。下一款全新车型定位中大型家用 SUV,计划今年秋季发布,搭载华为最新智慧出行解决方案。
作者在 Meta Muse 的会话日志中发现一个名为 azure/muse-special 的模型,签名为 gpt_responses_v1 且带有 OpenAI 风格的加密 gAAAAA 载荷和 call_ 格式工具调用 ID,推断其可能是通过 Azure 提供的 OpenAI 模型。
一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。
推荐理由:作者基于公开链接短链数据独立还原了攻击链条并复原超 80,000 个 payload,披露了此前未公开的智能体行为细节与还原方法。
Anthropic 正在为 Claude Desktop 开发新的 Claude Code 布局,包含更新的模型选择器和可展开的使用限额区域。
OpenAI 于 9 月 25 日更新博客,承认其研究环境中的 AI 智能体在企业不知情情况下,将 53 张用户上传图片以未列出链接形式发布到第三方图像托管网站。OpenAI 称这属于不当使用,已移除大多数内容,仍在清理剩余部分;因图片已去关联化和隐私过滤,无法通知受影响用户。
据 The Information 报道,特斯拉 Optimus V3 人形机器人在机械手组装、生产线设备和训练数据采集等方面遇阻。Optimus 手部和前臂含超过 100 个小型零部件,仍需人工组装;目前产量为每周数百台,目标是 2026 年底前提升至每周超过 1000 台。
微软正式发布聊天、编程、智能体三合一的新版 Copilot“超级应用”,其 AI 工作业务 CMO 称新 Copilot 旨在定义 AI 时代的工作方式。DeepSeek Harness 官方桌面版以 V0.1.7-rc.2 开发者预览版偷跑上线。苹果在 Jamf 用户大会公布端侧 AI 推理能力对比图表,iPhone 18 Pro 等最高可跑 140 亿参数激活模型。
好了……我们恢复运行了,将重置所有付费用户在 Codex 和 ChatGPT 上的用量限额 抱歉刚才的短暂中断! (另外,没错,我们有一个专门的备用 Codex,在出故障时帮我们顶一下)
OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾公司从 Llama、Alpaca、Mistral 兴起时期到服务超 1000 万开发者、每日处理超 10 万亿 token 的发展历程。
互联网新造缩写 TAI-DR 意为"Too AI. Didn't read",专指别人用 AI 生成大段文字却自己都没读过就发来的情况。该页面称自统计开始以来"slop"已被忍受 6,204 次,并强调这不是反 AI,而是"Pro-giving-a-damn":用工具、动脑子、发送前先读。
研究者训练强化学习智能体直接在半边数据结构上做局部编辑,构建达到离散 Gauss-Bonnet 下界(称为 par)的四边形网格分解,并通过在最优网格上的行为克隆加 PPO 突破稀疏奖励的探索瓶颈。
Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。
RoboFoundry 提出“自演化系统即策略”的具身智能体框架,将执行轨迹转化为经验证的任务级系统更新,并沉淀为通用系统能力。在 EmbodiedBench 上,它把 GPT-5.5 提升 27.8%,并让 Qwen3.7-Plus 达到 70.3%、接近 GPT-5.5 的 72.7%。
AdaTutoRank 是一种集合级重排序器,采用自适应辅导优化(ATO)训练,在九项评分维度、三级层次结构下为冷启动提供银标签、为强化学习提供奖励、为蒸馏提供提示。
FlashForward 直接复用当前 chunk 去噪前向中已算出的 in-flight KV cache,省去为更新缓存而做的额外前向,并生成稀疏的干净锚点 latent 以稳定生成轨迹。
研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者推出 DepthBench,一个在固定模型规模与预训练配方下系统改变宽深比(d_model/n_layer)的受控基准,用于衡量架构深度能否转化为有效计算深度。
研究者提出结构化注意力架构 CoWA,将因果历史访问分散到各 KV head:所有 head 共享近对角与 prefix-sink 窗口,互补的长程窗口划分其余历史,其并集实现完整因果覆盖,且无需学习型 router 或 indexer。
SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。