跳到正文

全部动态

今日 34 条
9月24日周四
  1. 公众号:面壁智能(MiniCPM)48

    火种说|给 Agent 做完大扫除,MiniCPM5-2B 把考研数学一做对了

    开发者在 M4 16GB 设备上基于 OpenHanako 框架适配 MiniCPM5-2B(本地 MLX 8bit 量化推理),通过裁剪 Computer Use、社交平台接入、图片视频生成等功能并新增 MiniCPM XML tool adapter,将工具面收缩到 11 个基础工具,解决了 2B 模型工具调用时的格式污染与指令漂移问题。

  2. 公众号:面壁智能(MiniCPM)26

    CNCC 2026 论坛:从实时全模态交互到自主智能体,端侧大模型如何迈向真正的端侧智能?

    CNCC 2026 将于 10 月 21-24 日在成都举办,其中一场论坛聚焦端侧大模型从"能对话"向"能感知、能推理、能行动"的端侧智能演进。论坛由清华大学刘知远、姚远担任主席,讲者将介绍 MiniCPM-o 4.5 的实时全模态类人交互能力、完全由 AI 编写并反超人工的训练框架 ForgeTrain,以及无分词器语音合成模型 VoxCPM。

  3. 公众号:百度智能云(文心)38

    1.395元复现Jev原型:百度千帆Token Plan最佳实践

    百度千帆Token Plan个人版以313.9积分(折合1.395元)支持Opencode(基座模型DeepSeek-V4-Flash)在llama.cpp中复现TypeSafe AI的Jev机制,用约400行C++把自回归LLM改造为单次前向传播的结构化决策引擎。

  4. 公众号:百度智能云(文心)35

    百度智能云首批获评国家信息安全服务资质(人工智能安全类一级)认证

    百度智能云通过中国信息安全测评中心评审,成为国内首批获评国家信息安全服务资质(人工智能安全类一级)的大模型厂商。该资质于2026年6月推出,从基座与模型安全、数据安全、运行环境安全、应用安全四个层面搭建评估框架,覆盖模型训练、上线部署、运行监测等关键阶段。百度智能云已形成覆盖“数据—模型—应用”全链路的安全体系,并以AI安全护栏对每次调用实施安全监测。

  5. 公众号:百度智能云(文心)25

    百度智能云灵医大模型登顶 MedBench 榜单,综合得分 76.1

    百度智能云灵医大模型在医疗大模型评测平台 MedBench 更新榜单中以综合得分 76.1 位列第一,并在医学知识问答、医学语言生成(并列第一)、复杂医学推理、医学语言理解等细分维度领先。灵医以智能体 Harness 架构为基础,依托持久会话记忆、技能管理和多智能体协作等机制面向真实临床场景持续优化。相关产品已累计落地医院客户 800+ 家、基层医疗机构 4000+ 家。

  6. 公众号:百度智能云(文心)37

    汉得信息与百度智能云达成战略合作,将百度伐谋智能体嵌入企业级AI中台

    9月23日,汉得信息与百度智能云签署战略合作框架协议,将百度伐谋自我演化超级智能体平台以算法SDK形式嵌入汉得企业级AI中台及“得·灵”产品体系。汉得信息由此成为百度伐谋在企业软件领域重点布局的综合性ISV战略伙伴,双方将围绕AI工艺优化、AI物流路径规划、AI数字化营销等场景联合打磨解决方案,降低企业AI应用门槛。

  7. 公众号:百度智能云(文心)30

    百度石清华对话车百会张永伟:让智能体真正跑进车企

    百度副总裁石清华与车百会研究院理事长张永伟围绕中国汽车产业AI转型展开对话,指出车企AI转型的真正挑战在组织层面,即从"使用AI工具"走向"成为AI企业"。百度智能云在2026智能经济论坛上提出"产业智能体操作系统"理念,并推出"快、广、深"场景规划方法论,帮助车企将智能体嵌入实际生产环节。双方还联合出品白皮书《中国汽车产业AI转型的路径》,给出场景、数据、平台、组织、生态五层路径。

  8. 公众号:数字生命卡兹克57

    闲鱼上的ChatGPT代充暗号:从奥特曼充电到Tibo洗衣粉的斗智斗勇

    作者实测闲鱼上ChatGPT代充的隐语生态,因直接搜GPT属违规,卖家造出奥特曼充电、鸡屁踢、DeepSeek老祖宗、Tibo洗衣粉等暗号,版本快速轮动且不断被封。交易需加微信后提供含访问令牌的会话代码,一单约135至140元,价格随汇率浮动且按天退款。文章以《我不是药神》类比平台、用户、卖家三方各有难处的困局,认为真正好的技术应是消灭摩擦的基础设施,并期待国产模型崛起让这类暗号失去意义。

  9. 公众号:千问APP(阿里)40

    千问在云栖大会分享 Personal Agent 进展:接入个人数据,开放平台覆盖 20 多个领域

    千问在 2026 云栖大会上公布 Personal Agent 阶段性进展,依托 Qwen 3.8 系列模型的 Agentic 能力,为 3 亿用户提供个性化服务。用户授权后可接入健康、运动等个人数据,理财场景支持连接个人持仓,专项 Harness 优化使回复效果提升 20%。千问开放平台已覆盖 20 多个领域,申请入驻伙伴超过 1000 家。

  10. 公众号:千问APP(阿里)37

    千问「健康档案」升级:基于 Qwen3.8 系列模型新增数据解读与智能跟进

    千问「健康档案」全新升级,依托 Qwen3.8 系列模型的 Agentic 能力,新增数据解读与智能跟进功能,可从主流智能手表、手环、动态血糖仪等设备健康应用接入数据,并支持手动记录病史、过敏史等医疗健康信息。升级后的档案能整合睡眠、运动、心率等分散数据,构建长期动态的个人 Context,并主动跟进每周运动 3 次、5 公里跑等健康目标,定期复盘表现。该功能支持隐私模式,可按需开启。

  11. 公众号:阶跃星辰(Step)34

    阶跃星辰 Step 5 Preview 上线 TRAE,DeepSWE 得分 67.7

    阶跃星辰 Step 5 Preview 已在豆包旗下 AI 开发产品 TRAE 上线,可直接调用。该模型覆盖 9 类任务、33 种编程语言,支持理解复杂代码库、跨文件修改、Bug 修复、重构、性能调优及持续数小时的长程任务,DeepSWE 得分 67.7,ProgramBench 通过率 80.5%。

  12. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

  13. HuggingFace Daily Papers(社区热门论文)47

    Uranus:面向具身智能的下一代仿真基础设施

    研究者发布数据驱动的机器人仿真器 Uranus,基于关节轨迹条件的自回归扩散模型,可在线接收未来关节位置轨迹并逐步自回归生成隐帧,每步对应四帧 RGB,无固定时长限制。经推理优化后生成速度达 24 FPS,并提供统一接口支持多种机器人形态与相机配置的同步多视角生成。代码与模型权重已开源。

  14. Latent Space67

    Meta Connect 2026:Muse 智能体、眼镜硬件与实时语音

    Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可为每台 Muse 分配独立邮箱,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用,Muse Realtime Avatar 以研究形式发布,输出带水印且响应低于一秒。

  15. IT之家(RSS)51

    高通携手 PrismML 发布 1-bit Bonsai 视觉模型,可在骁龙 AR1 Gen 1 智能眼镜上本地运行

    在 2026 骁龙峰会上,高通与 PrismML 发布 1-bit 量化 Bonsai 视觉语言模型,基于 Bonsai 1.7B 构建,可在骁龙 AR1 Gen 1 智能眼镜平台本地运行 20 亿参数模型。官方称相同内存下可容纳约 4 倍参数,内存占用约为传统 4-bit 模型的 1/4,文本 Token 生成速度翻倍,识图、翻译、环境问答等交互可离线完成,同时降低功耗、改善续航与发热。

  16. IT之家(RSS)71

    OpenAI 为 ChatGPT 移动端新增语音智能体功能,可语音撰写文档、总结邮件

    OpenAI 宣布 ChatGPT 移动端新增基于语音的智能体功能,用户可通过说话完成撰写文档、总结电子邮件等工作。Pro 和 Plus 订阅用户可用"工作"创建文档、写邮件、总结 Slack 消息,还能创建网站、制作 PPT、使用云端浏览器;Free 和 Go 用户可使用插件和已连接的应用,Plus 用户可在文本和语音间切换,或从手机转到电脑继续。

  17. IT之家(RSS)46

    特斯拉 App 泄露第三代 Optimus 人形机器人渲染模型,双手 22 个自由度

    特斯拉 Android App 中被发现内置了未经遮挡的 Optimus Gen 3 人形机器人 UI 渲染模型,与 Gen 2.5 原型机相比,Gen 3 骨盆和髋部加入一体式柔性关节护罩,金色饰面改为哑光黑配香槟金,双手拥有 22 个自由度。该版本定位工厂大规模量产,特斯拉已改造弗里蒙特工厂产线用于组装 Optimus,目标产能爬坡后年产 100 万台。

  18. IT之家(RSS)26

    华为余承东:问界今年上市新车仍由华为团队主导设计

    华为余承东 9 月 24 日在合肥鸿蒙智行门店表示,问界今年上市的新车仍由华为团队主导、设计,预计指问界新 M8。同日问界官方公开新 M8 旗舰 SUV 外观,带来「天幕青」和「苍戎绿」两款全新车色。余承东还剧透尊界大型超豪华 SUV 将在明年初上市。

  19. IT之家(RSS)43

    谷歌确认 Gemini 4 即将推出,已进入后训练初期

    谷歌 DeepMind 负责人科拉伊·卡武克奥卢确认,新一代旗舰模型 Gemini 4 已进入后训练初期,希望“远早于年底”推出。Gemini 4 是 Gemini 3 系列后首款下一代旗舰模型,目前处于防护机制开发和安全测试阶段,谷歌工程师已在内部用它运行 Antigravity AI 编程工具。卡武克奥卢表示当前重点是推出 Gemini 4,未说明 Gemini 3.5 Pro 是否正式取消。

  20. IT之家(RSS)75

    曝 DeepSeek 确定 75 亿美元第二轮融资,年化营收突破 10 亿美元

    据 The Information 报道,DeepSeek 年化营收突破 10 亿美元,已确定 75 亿美元(约合 504.2 亿元人民币)融资。公司计划 10 月底前完成本轮融资,目标募资 500 亿元人民币,估值目标 5,000 亿元人民币,并筹备在上交所上市。梁文锋称 70% 以上算力投入模型训练,调价未造成客户流失,轻量化模型可在游戏显卡上稳定运行。

  21. IT之家(RSS)49

    腾讯混元宣布“腾讯 Hy 翻译”App 上线,支持 33 种语言互译

    腾讯混元宣布“腾讯 Hy 翻译”App 上线,同步支持小程序、插件和 PC 端,基于 Hy-MT2 翻译模型打造,支持 33 种语言互译并覆盖 5 种中国少数民族语言及方言。该 App 提供语音、拍照和离线翻译,现已在 12 个国家和地区上线。Hy-MT2 于今年 5 月开源,在多语言指令遵循、专业领域翻译和真实场景翻译上较上一代 Hy-MT1.5 明显提升。

  22. HuggingFace Daily Papers(社区热门论文)37

    联合视频生成中的跨注意力鸿沟:RecCAR 让视频与动作、音频互相对齐

    研究者发现联合多模态扩散 Transformer 存在"互惠对应鸿沟":动作、音频等伴随模态能强对应视频,反向约束视频的对应却明显偏弱。为此提出 KL 正则化方法 RecCAR,以视频到模态的对应为固定参照,拉齐较弱的模态到视频对应。在视频-动作与视频-音频生成中,RecCAR 将 Human Anatomy 分数从 0.69 提升至 0.75,音视频不同步从 0.804 降至 0.752。

  23. HuggingFace Daily Papers(社区热门论文)40

    高维潜空间的可扩散性:RAE 中 x₀-prediction 如何提升文生图生成

    针对 Representation Autoencoders(RAEs)中高保真重建编码器会降低表征有效维度、导致 flow matching 标准速度预测需拟合信号流形外的正交噪声方向、优化低效的问题,论文提出改用干净数据参数化(x₀-prediction),将学习集中在底层信号流形上。在多个强重建编码器实验中,x₀-prediction 一致提升了文生图生成性能。