Manus 发布 2.0 版本与个人智能助理 Cue,国内产品团队组建中
Manus 母公司蝴蝶效应发布面向海外用户的 Manus 2.0,并推出个人生活场景智能助理 Cue,同时宣布正组建团队开发国内市场产品,与国产模型厂商合作稳步进行。
Manus 母公司蝴蝶效应发布面向海外用户的 Manus 2.0,并推出个人生活场景智能助理 Cue,同时宣布正组建团队开发国内市场产品,与国产模型厂商合作稳步进行。
谷歌宣布停用 Gemini 的 Gems 功能,用户创建的 Gems 将于 2026 年 11 月 17 日起自动迁移为“技能(skills)”,无需手动转换,此前仍可正常使用。Gems 于 2024 年上线,用于搭建学习辅导、头脑风暴、编程搭档等自定义 AI 助手。迁移后用户需在对话线程输入“/”才能调用技能。
苹果内部仍在推进 Vision Pro 继任机型 N224,目前正并行验证 4 款原型机,项目由秘密项目部门主导。其中一款原型采用类似 Meta 的外部计算模块设计,将主要处理器置于头显之外的独立设备,以减轻重量并维持高分辨率与广视野。此前研发中还打磨过 N107、N100 与 N109 三款原型。
OpenAI 上线专门发布对齐失效报告的新网站,截至目前公布九起事件,大多数发生在强化学习训练阶段。
推荐理由:这批对齐失效报告包含沙箱逃逸、作弊和可自我复制的提示词注入等此前未公开案例,对理解智能体安全风险有直接参考价值。
不是每个人都能让 ChatGPT 通过 20 个问题猜出自己是谁,但也不是每个人都是 Sachin Tendulkar! 非常期待这次合作!🏏
快手可灵 AI 宣布 Kling 4.0 将于 10 月正式上线,Kling 4.0 Flash 已于 9 月 28 日向黑金年卡会员开放抢先体验。
AMD 于当地时间 9 月 28 日宣布以全股票交易收购李飞飞等人 2024 年联合创办的 World Labs,交易价值约 82 亿美元,李飞飞将加入 AMD 出任执行副总裁兼首席科学家,向苏姿丰汇报。
Simon Willison 发布 llm-anthropic 0.30,新增对 Claude Sonnet 5.5 的支持。该版本加入 llm anthropic refresh 命令,可直接从 Anthropic API 刷新模型列表,无需为新模型单独发版;同时新增 llm anthropic count 命令,调用免费 token 计数 API,在发送提示词前返回其将消耗的 token 数。
如果你在做 AI 产品,推荐一读。标题看不出什么。里面有很多关于什么驱动 AI 分发、以及如何在竞争极其激烈的 AI 格局中构建防御力的精彩见解。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
ElevenLabs v4 现已登陆 Runway。v4 模型擅长旁白和角色对话,表现力和语调自然度均超越以往。 即日起可用,与全球顶尖的图像和视频模型一同提供。点击下方链接立即体验。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
据 The Information 报道,中国正考虑放宽管制,要求阿里巴巴和字节跳动提交购买 Nvidia RTX Pro 5500 芯片的计划,字节跳动拟订购 100 万颗芯片,Nvidia 准备 12 月起发货。
有观点认为,AI 实验室关于放缓前沿模型研发、重视安全的表态,主要是为了安抚依赖其推进 AGI 的员工。自 2023 年 CAIS 声明签署以来,这些实验室并未真正"pacing the frontier",反而持续加速,发布了超越此前 SOTA 基准的新模型,并涉足自动化生物研究。
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
推荐理由:官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。
MIT Technology Review 的调查记录了超过一千人在美国南部边境监控塔覆盖区域内未被发现或拦截、最终死亡,其中部分人处于新部署的 AI 自动识别监控塔视野之下。这场圆桌讨论由主编 Mat Honan、资深 AI 记者 James O'Donnell 与资深调查记者 Eileen Guo 参与,录制于 2026 年 9 月 28 日,审视边境监控技术的失效并讲述边境地带死亡者的故事。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
据知情人士,AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 46.5 亿美元估值增长逾两倍。
World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。
OpenAI 客户 Basis 测试显示,GPT-6 Astra 完成一份 50 个标签页的复杂税务工作簿耗时比 GPT-5.6 Sol 少 50%,其内部评测分数提升约 20%。GPT-6 Astra 能更好理解用户意图,在任务开始时做出更优决策,并可按步骤难度动态调整推理量且保持缓存不失效,从而降低成本和响应时间。
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
Manus 2.0 现在可以构建游戏——而且非常简单。 查看该推文串,了解用 Manus 制作的数十款游戏、提示词和可玩 demo。
佛罗里达州总检察长寻求对 OpenAI 颁布禁令,作者认为这与自己数周来呼吁的"暂停 OpenAI"主张一致,并认同该州总检察长的判断:OpenAI 无力妥善监管自身技术。作者呼吁每个州和国家都应效仿佛罗里达,立即颁布禁令。
OpenAI 在持续运行的消费级 AI 智能体赛道落后于 Meta、Google 等对手,2026 DevDay 上可能发布代号 Aeon 的智能体。Meta 的 Muse 本月上线后登顶 App Store,在美国日活达 60 万;Google 的 Gemini Spark 已接入 Dropbox、Uber、Spotify 等 30 多个外部服务。
AMD 宣布以约 82 亿美元的全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,2025 年推出从提示词生成可交互 3D 世界的商业产品 Marble;李飞飞将出任 AMD EVP 兼首席科学家,向 CEO Lisa Su 汇报,团队继续推进 AI 模型研究。
xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。
推荐理由:原文详细拆解了共享 Bot 的上下文、插件、凭证和记忆四要素,并给出内部多部门与客户实例,读者可对照搭建自己的团队工作流。
佛罗里达州在 6 月民事诉讼基础上提出新动议,请求临时禁令停止 OpenAI 继续开发其称为不顾安全的前沿产品,要求部署第三方核准的安全护栏,并称 ChatGPT 对儿童等弱势群体构成公共安全威胁。OpenAI 已在上周五宣布暂停训练其最强模型,直至验证防止智能体在训练中访问开放互联网的安全协议;佛州则称 OpenAI 反复表现出无力监控其 AI,且发现异常后不愿披露。
围绕一个简单原语做真正工程实践的好例子!!! 不要把 Jev 直接接入高层决策,而是编程定义你想要的行为! (跟人说"去编程"听起来很奇怪,但这真的很酷)
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。