火种说|给 Agent 做完大扫除,MiniCPM5-2B 把考研数学一做对了
开发者在 M4 16GB 设备上基于 OpenHanako 框架适配 MiniCPM5-2B(本地 MLX 8bit 量化推理),通过裁剪 Computer Use、社交平台接入、图片视频生成等功能并新增 MiniCPM XML tool adapter,将工具面收缩到 11 个基础工具,解决了 2B 模型工具调用时的格式污染与指令漂移问题。
开发者在 M4 16GB 设备上基于 OpenHanako 框架适配 MiniCPM5-2B(本地 MLX 8bit 量化推理),通过裁剪 Computer Use、社交平台接入、图片视频生成等功能并新增 MiniCPM XML tool adapter,将工具面收缩到 11 个基础工具,解决了 2B 模型工具调用时的格式污染与指令漂移问题。
CNCC 2026 将于 10 月 21-24 日在成都举办,其中一场论坛聚焦端侧大模型从"能对话"向"能感知、能推理、能行动"的端侧智能演进。论坛由清华大学刘知远、姚远担任主席,讲者将介绍 MiniCPM-o 4.5 的实时全模态类人交互能力、完全由 AI 编写并反超人工的训练框架 ForgeTrain,以及无分词器语音合成模型 VoxCPM。
百度千帆Token Plan个人版以313.9积分(折合1.395元)支持Opencode(基座模型DeepSeek-V4-Flash)在llama.cpp中复现TypeSafe AI的Jev机制,用约400行C++把自回归LLM改造为单次前向传播的结构化决策引擎。
百度智能云通过中国信息安全测评中心评审,成为国内首批获评国家信息安全服务资质(人工智能安全类一级)的大模型厂商。该资质于2026年6月推出,从基座与模型安全、数据安全、运行环境安全、应用安全四个层面搭建评估框架,覆盖模型训练、上线部署、运行监测等关键阶段。百度智能云已形成覆盖“数据—模型—应用”全链路的安全体系,并以AI安全护栏对每次调用实施安全监测。
百度智能云联合 SGLang 社区于 9 月 22 日举办“Agent 时代的推理基础设施”Meetup,围绕多芯适配、上下文缓存、KV Cache 优化、显存优化、MoE 专家压缩和推理服务治理展开生产级实践分享。
百度智能云灵医大模型在医疗大模型评测平台 MedBench 更新榜单中以综合得分 76.1 位列第一,并在医学知识问答、医学语言生成(并列第一)、复杂医学推理、医学语言理解等细分维度领先。灵医以智能体 Harness 架构为基础,依托持久会话记忆、技能管理和多智能体协作等机制面向真实临床场景持续优化。相关产品已累计落地医院客户 800+ 家、基层医疗机构 4000+ 家。
9月23日,汉得信息与百度智能云签署战略合作框架协议,将百度伐谋自我演化超级智能体平台以算法SDK形式嵌入汉得企业级AI中台及“得·灵”产品体系。汉得信息由此成为百度伐谋在企业软件领域重点布局的综合性ISV战略伙伴,双方将围绕AI工艺优化、AI物流路径规划、AI数字化营销等场景联合打磨解决方案,降低企业AI应用门槛。
百度副总裁石清华与车百会研究院理事长张永伟围绕中国汽车产业AI转型展开对话,指出车企AI转型的真正挑战在组织层面,即从"使用AI工具"走向"成为AI企业"。百度智能云在2026智能经济论坛上提出"产业智能体操作系统"理念,并推出"快、广、深"场景规划方法论,帮助车企将智能体嵌入实际生产环节。双方还联合出品白皮书《中国汽车产业AI转型的路径》,给出场景、数据、平台、组织、生态五层路径。
Anthropic 发布 Claude Opus 5.5,上下文1M Token,输入4美元/输出20美元每百万Token,比Opus 5成本降40%、速度快30%以上,Terminal-Bench 4.0拿66.4%创最高分,定位为Fable 5.1的性价比替代。
作者实测闲鱼上ChatGPT代充的隐语生态,因直接搜GPT属违规,卖家造出奥特曼充电、鸡屁踢、DeepSeek老祖宗、Tibo洗衣粉等暗号,版本快速轮动且不断被封。交易需加微信后提供含访问令牌的会话代码,一单约135至140元,价格随汇率浮动且按天退款。文章以《我不是药神》类比平台、用户、卖家三方各有难处的困局,认为真正好的技术应是消灭摩擦的基础设施,并期待国产模型崛起让这类暗号失去意义。
千问在 2026 云栖大会上公布 Personal Agent 阶段性进展,依托 Qwen 3.8 系列模型的 Agentic 能力,为 3 亿用户提供个性化服务。用户授权后可接入健康、运动等个人数据,理财场景支持连接个人持仓,专项 Harness 优化使回复效果提升 20%。千问开放平台已覆盖 20 多个领域,申请入驻伙伴超过 1000 家。
千问「健康档案」全新升级,依托 Qwen3.8 系列模型的 Agentic 能力,新增数据解读与智能跟进功能,可从主流智能手表、手环、动态血糖仪等设备健康应用接入数据,并支持手动记录病史、过敏史等医疗健康信息。升级后的档案能整合睡眠、运动、心率等分散数据,构建长期动态的个人 Context,并主动跟进每周运动 3 次、5 公里跑等健康目标,定期复盘表现。该功能支持隐私模式,可按需开启。
千问创作上线 10 元 7 天会员,开通即享 200 积分,可生成图片模板约 200 次。会员可解锁海量付费模板与高阶模型,主打旅途风景一键出片、热门创意模板即开即用。
阶跃星辰 Step 5 Preview 已在豆包旗下 AI 开发产品 TRAE 上线,可直接调用。该模型覆盖 9 类任务、33 种编程语言,支持理解复杂代码库、跨文件修改、Bug 修复、重构、性能调优及持续数小时的长程任务,DeepSWE 得分 67.7,ProgramBench 通过率 80.5%。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
研究者发布数据驱动的机器人仿真器 Uranus,基于关节轨迹条件的自回归扩散模型,可在线接收未来关节位置轨迹并逐步自回归生成隐帧,每步对应四帧 RGB,无固定时长限制。经推理优化后生成速度达 24 FPS,并提供统一接口支持多种机器人形态与相机配置的同步多视角生成。代码与模型权重已开源。
Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可为每台 Muse 分配独立邮箱,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用,Muse Realtime Avatar 以研究形式发布,输出带水印且响应低于一秒。
在 2026 骁龙峰会上,高通与 PrismML 发布 1-bit 量化 Bonsai 视觉语言模型,基于 Bonsai 1.7B 构建,可在骁龙 AR1 Gen 1 智能眼镜平台本地运行 20 亿参数模型。官方称相同内存下可容纳约 4 倍参数,内存占用约为传统 4-bit 模型的 1/4,文本 Token 生成速度翻倍,识图、翻译、环境问答等交互可离线完成,同时降低功耗、改善续航与发热。
OpenAI 宣布 ChatGPT 移动端新增基于语音的智能体功能,用户可通过说话完成撰写文档、总结电子邮件等工作。Pro 和 Plus 订阅用户可用"工作"创建文档、写邮件、总结 Slack 消息,还能创建网站、制作 PPT、使用云端浏览器;Free 和 Go 用户可使用插件和已连接的应用,Plus 用户可在文本和语音间切换,或从手机转到电脑继续。
特斯拉首次向北美搭载 HW3 硬件的 Model S 和 Model X 推送 FSD v14.2 Lite,此前 HW3 版 Model 3 和 Model Y 已于今年 7 月获得 FSD v14 Lite。
特斯拉 Android App 中被发现内置了未经遮挡的 Optimus Gen 3 人形机器人 UI 渲染模型,与 Gen 2.5 原型机相比,Gen 3 骨盆和髋部加入一体式柔性关节护罩,金色饰面改为哑光黑配香槟金,双手拥有 22 个自由度。该版本定位工厂大规模量产,特斯拉已改造弗里蒙特工厂产线用于组装 Optimus,目标产能爬坡后年产 100 万台。
华为余承东 9 月 24 日在合肥鸿蒙智行门店表示,问界今年上市的新车仍由华为团队主导、设计,预计指问界新 M8。同日问界官方公开新 M8 旗舰 SUV 外观,带来「天幕青」和「苍戎绿」两款全新车色。余承东还剧透尊界大型超豪华 SUV 将在明年初上市。
谷歌 DeepMind 负责人科拉伊·卡武克奥卢确认,新一代旗舰模型 Gemini 4 已进入后训练初期,希望“远早于年底”推出。Gemini 4 是 Gemini 3 系列后首款下一代旗舰模型,目前处于防护机制开发和安全测试阶段,谷歌工程师已在内部用它运行 Antigravity AI 编程工具。卡武克奥卢表示当前重点是推出 Gemini 4,未说明 Gemini 3.5 Pro 是否正式取消。
启境 GX7 上市 18 小时大定达 15,318 台,全国已开始陆续交付,限时权益价 22.99 万-29.19 万元。该车由广汽携手华为乾崑打造,搭载华为乾崑智驾 ADS 5、鸿蒙座舱 6 等七大智能化方案,首批搭载车型首发萌宠小紫貂“奇奇”。
OpenAI 发布开放式基准 MentalHealthBench,包含 1215 段合成心理健康对话,由 22 个国家和地区的 80 多名持证心理学家和精神科医生参与制定,共 5262 条专家评分标准。
据 The Information 报道,DeepSeek 年化营收突破 10 亿美元,已确定 75 亿美元(约合 504.2 亿元人民币)融资。公司计划 10 月底前完成本轮融资,目标募资 500 亿元人民币,估值目标 5,000 亿元人民币,并筹备在上交所上市。梁文锋称 70% 以上算力投入模型训练,调价未造成客户流失,轻量化模型可在游戏显卡上稳定运行。
腾讯混元宣布“腾讯 Hy 翻译”App 上线,同步支持小程序、插件和 PC 端,基于 Hy-MT2 翻译模型打造,支持 33 种语言互译并覆盖 5 种中国少数民族语言及方言。该 App 提供语音、拍照和离线翻译,现已在 12 个国家和地区上线。Hy-MT2 于今年 5 月开源,在多语言指令遵循、专业领域翻译和真实场景翻译上较上一代 Hy-MT1.5 明显提升。
Tripo 转发 Jeffrey Katzenberg 长文《The World is Changing: AI For Creativity》。
研究者发现联合多模态扩散 Transformer 存在"互惠对应鸿沟":动作、音频等伴随模态能强对应视频,反向约束视频的对应却明显偏弱。为此提出 KL 正则化方法 RecCAR,以视频到模态的对应为固定参照,拉齐较弱的模态到视频对应。在视频-动作与视频-音频生成中,RecCAR 将 Human Anatomy 分数从 0.69 提升至 0.75,音视频不同步从 0.804 降至 0.752。
针对 Representation Autoencoders(RAEs)中高保真重建编码器会降低表征有效维度、导致 flow matching 标准速度预测需拟合信号流形外的正交噪声方向、优化低效的问题,论文提出改用干净数据参数化(x₀-prediction),将学习集中在底层信号流形上。在多个强重建编码器实验中,x₀-prediction 一致提升了文生图生成性能。
等不及下周二的 DevDay 了。 有一些非常有趣的东西,但也有很多应该改变你工作方式的内容。这是我们最有野心的一次冲刺,Astra 真的在如此短的时间内让新事物成为可能。