跳到正文

#多模态

今日 4 条
9月17日周四
  1. IT之家(RSS)65

    高德地图 2026 发布:导航 Live 实时感知环境,上线避雷指南

    高德地图 2026 发布,核心升级导航 Live 将自然对话、多模态感知和空间理解融入驾车、步行和游览场景,可识别施工等路况、按需求调整路线并生成与行程时长匹配的个性化播客。高德 AI 对话聚焦出发前复杂出行规划,可调用避雷指南从营业时间、行程节奏等 15 个维度提前识别风险;鹰眼守护预警系统新增 4 类骑行场景,覆盖风险由 24 类扩展至 28 类,累计播发预警超 629 亿次。

9月16日周三
  1. Mistral AI:News(网页)78

    Mistral AI 与 Mozilla 合作,为 Firefox 智能窗口提供模型支持

    2026年9月16日,Mistral AI 宣布与 Mozilla 达成合作,其模型将驱动 Firefox 的 AI 浏览助手“Smart Window”(测试版)。该功能帮助用户处理复杂搜索、记忆浏览内容并基于标签页获取信息。初期覆盖法国和北美用户,英德随后跟进。双方强调开源、隐私保护(默认不保存对话、零数据保留)及针对区域语言和文化语境优化的能力,旨在打破单一公司垄断,赋予用户对 AI 交互的控制权。

  2. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁 inclusionAI 开源 Realtime-Venus 全双工交互系统

    蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。

    推荐理由:蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。

  3. IT之家(RSS)54

    努比亚 NaviX Ultra 发布:主打 AI 智能体能力,5999 元起

    努比亚发布 NaviX Ultra 手机,宣称是首款 AI 智能体手机,售价 5999 元起,国补后 5499 元起。该机由豆包手机助手主导 AI 体验,搭载 Seed 全双工语音大模型和第五代骁龙 8 至尊版,支持一句话跨应用执行任务,端到端任务成功率超 80%,AI 唤醒率优于竞品 48%,并完成智能体大模型备案。

  4. IT之家(RSS)58

    初探苹果首款折叠 iPhone Duo 影像体验:智能拍摄、看看镜头、Duo FaceTime 等

    据 MacRumors 报道,苹果为首款折叠手机 iPhone Duo 的双屏设计定制了新拍摄体验,包括利用 A20 Pro 芯片设备端 AI 在摆好姿势时自动拍合照的智能拍摄(Smart Take)、用外屏播放《花生漫画》吸引孩子看镜头的看看镜头(Kid Cue)、外屏实时取景的 Duo 预览,以及好友可经外屏加入通话的 Duo FaceTime。

  5. OpenRouter:Announcements(RSS)73

    DeepSeek V4 哪些型号支持图像输入?OpenRouter 逐款梳理与调用指南

    OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。

    推荐理由:原文逐一列出 DeepSeek V4 各型号是否支持图像输入、价格和调用方式,并给出文本-only 型号配视觉模型的两段式替代方案。

  6. 🚨 AI News | TestingCatalog55

    Creatify Labs 发布面向视频广告的文生视频与图生视频模型 Boreal,定价每秒 $0.01,已向所有 Creatify 用户开放。模型基于开源权重的 LTX-2.5 后训练,训练语料包括真实广告素材、创作者风格 UGC 和客户制作需求;官方称在 40 多个制作案例的盲测人评中,后训练使 Boreal 对基座模型的胜率达 81%,并称其比 Seedance 2.5 最多便宜 47 倍。

  7. Rohan Paul54

    Odyssey 发布基础世界模型 Odyssey-3,称其可控制机器人、驱动人形、驾驶车辆、训练 AI、操控无人机甚至玩视频游戏。其路线是先用预训练世界模型,再接上用数十小时机器人演示训练的动作解码器;据作者转述,驾驶策略仅用 20 小时模拟数据训练后就能驶上印度真实街道,机械臂、人形遥操作和模拟无人机数据的用量也仅为数十小时。

  8. Google Blog:AI(RSS)63

    Google 发布 TranslateGemma 等多语言 AI 成果,语言技术覆盖 300 多种语言

    Google 宣布其语言技术已支持超过 300 种语言、覆盖全球 86% 人口,并发布 TranslateGemma 轻量开源翻译模型(基于 Gemini 训练、支持 55 种语言、可离线运行)。

    推荐理由:原文来自 Google 对其语言技术的系统性梳理,读者可以借此了解其多语言 AI 的技术路线和数据合作方式。

9月15日周二
  1. AK52

    Vidu S2 论文发布,提出实时交互、可编辑和空间视频生成,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing。Vidu S2-Avatar 相比 Vidu S1 支持实时 720p 生成、可随时更新的动态参考和更强的指令遵循;Vidu S2-Editing 支持对视频流实时编辑,包括风格渲染、服装、角色和背景替换。论文链接 https://huggingface.co/papers/2609.11638,在线演示 https://vidu.com/vidu-stream。

  2. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。

  3. Hacker News 热门(buzzing.cc 中文翻译)54

    fugleramme 开源:用 Raspberry Pi 和 BirdNET-Go 打造能聆听鸟鸣的电子墨水画框

    作者开源 fugleramme,一个基于 Raspberry Pi 5 和 Inky Impression 13.3 英寸电子墨水屏的画框,通过 BirdNET-Go 在本地实时识别麦克风听到的鸟鸣,并匹配 19 世纪公共领域博物学插画渲染展示,已收录超过 800 张手工抠图、覆盖 400 多个物种。

  4. IT之家(RSS)60

    新型脑机接口首次同步解码语言与肢体动作

    NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。

  5. HuggingFace Daily Papers(社区热门论文)59

    Zing-0.5 发布 5B 实时联合动作与文本控制世界模型

    Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。