#多模态
#多模态
今日 4 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分6464
Rohan Paul@rohanpaul_aiAI 评分5656The Verge:AI(RSS)AI 评分5757 Google 在 Pixel 11 上推出 Gemini 代打电话功能,可代用户联系本地商家
Google 在 Pixel 11 上推出早期实验功能,用户可在 Gemini 应用中让 AI 代打电话给本地商家,用于订位、查库存或改约等。Gemini 会自报身份、操作语音菜单、等待接听并完成对话,用户可通过实时转写查看并随时接管;功能自今日起向美国地区加入 Phone by Google Public Beta 的 Gemini 付费订阅用户开放。
elvis@omarsar0AI 评分5252
Liquid AI 模型与工程博客(网页)AI 评分5757 Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
Hugging Face:Blog(RSS)AI 评分5757 Liquid AI 发布 LFM2.5-VL-DSpark 视觉草稿模型加速 VLM 推理
Liquid AI 在 Hugging Face 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取推理加速。
公众号:卡尔的AI沃茨AI 评分7474 实测小米 MiMo-V2.6 系列模型:开源分第一,价格低至同级海外模型的几十分之一
小米发布 MiMo-V2.6-Pro、Flash 和 Pro-UltraSpeed 三款模型,UltraSpeed 输出速度最高达 Pro 的 20 倍。
Latent SpaceAI 评分6767 Meta Connect 2026:Muse 智能体、眼镜硬件与实时语音
Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可为每台 Muse 分配独立邮箱,Mac 版支持 computer use,连接器平台覆盖 1500+ 应用,Muse Realtime Avatar 以研究形式发布,输出带水印且响应低于一秒。
IT之家(RSS)AI 评分5151 高通携手 PrismML 发布 1-bit Bonsai 视觉模型,可在骁龙 AR1 Gen 1 智能眼镜上本地运行
在 2026 骁龙峰会上,高通与 PrismML 发布 1-bit 量化 Bonsai 视觉语言模型,基于 Bonsai 1.7B 构建,可在骁龙 AR1 Gen 1 智能眼镜平台本地运行 20 亿参数模型。官方称相同内存下可容纳约 4 倍参数,内存占用约为传统 4-bit 模型的 1/4,文本 Token 生成速度翻倍,识图、翻译、环境问答等交互可离线完成,同时降低功耗、改善续航与发热。
IT之家(RSS)AI 评分7575 阿里达摩院发布食管癌 AI 模型 DAMO EAGLE,平扫 CT 不插管识别早期病变
阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构发布食管癌筛查 AI 模型 DAMO EAGLE,无需插管和造影,从平扫 CT 识别包括早期和癌前病变在内的食管癌,论文 9 月 22 日发表于《自然·医学》。
IT之家(RSS)AI 评分5454 Meta 发布类似电子宠物的 AI 设备 Muse Charm,12 月假期前发售
Meta 在 Meta Connect 活动上发布基于 Muse AI 助手的小型设备 Muse Charm,计划 12 月假期前发售,售价接近智能手表,具体价格未公布。
IT之家(RSS)AI 评分6666 Meta 发布 349 美元起 Ray-Ban Meta Audio 音频眼镜及 Ray-Ban Meta(Gen 3)等多款 AI 眼镜
Meta 在 Connect 大会上发布首款音频眼镜 Ray-Ban Meta Audio,重约 43 克,续航最长 12 小时,起售价 349 美元,10 月 13 日发货;同时推出 Ray-Ban Meta(Gen 3),起售价 449 美元,续航最长 9 小时,搭载 1200 万像素摄像头,支持 3K Ultra HD 视频录制。
The Verge:AI(RSS)AI 评分6262 Meta 为 Muse 智能体推出视频通话和邮箱等新能力
Meta 在 Meta Connect 2026 上宣布对 Muse AI 智能体的多项更新:Muse 将获得可用于执行任务的专属邮箱地址,用户也可通过该邮箱与它沟通;Muse Mac 应用将能操作用户的电脑。
The Verge:AI(RSS)AI 评分5959 Meta 宣布将把 AI 智能体 Muse 带入智能眼镜
Meta 在 Meta Connect 2026 上宣布正将发布仅数周的 AI 智能体 Muse 引入其智能眼镜,用户可通过呼出名称让 Muse 引导锻炼、记录饮食或辅助购物。
Meta Engineering Blog(RSS)AI 评分5555 Meta 为 AI 眼镜推出 Private Processing 机密计算基础设施
Meta 宣布将 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,把信任边界延伸到云端 CVM,使包括 Meta 在内的任何人都无法访问用户数据。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 TrackEverything:突破长视频稠密3D点追踪的显存瓶颈
TrackEverything提出一种新的3D点追踪模型,通过去重3D场景表示解决稀疏长时与稠密短时追踪的权衡问题。该模型利用体素化去重、端点细化器及3D WAFT技术,将模型复杂度与视频时长解耦。它是首个能在40GB显存内对超过1000帧视频进行全可见点追踪的3D追踪器,在TAPVid-3D基准上表现优于现有开源稠密追踪器。
TechCrunch:AI(RSS)AI 评分6363 Meta 在 Connect 2026 发布无摄像头 AI 眼镜 Ray-Ban Meta Audio,起价 $349
Meta 在 Connect 2026 大会上发布首款无摄像头 AI 眼镜 Ray-Ban Meta Audio,仅支持音频,可听音乐播客、接打电话、翻译语音并与 AI 助手 Muse 对话,起价 $349,10 月 13 日开启预订。
The Verge:AI(RSS)AI 评分6060 Meta Connect 2026:Meta 发布 Meta VR Glasses、无摄像头 Ray-Ban Meta Audio Glasses 并扩展 Muse 智能体
Meta 在 Connect 2026 上发布多款新品:100g 的 Meta VR Glasses(Quest 3 为 515g)将沉浸式显示分散到眼镜与口袋计算 puck 中,2027 年春季上市;无摄像头的 Ray-Ban Meta Audio Glasses 回应穿戴拍摄争议。
Ars Technica:AI(RSS)AI 评分5959 XPRIZE Wildfire 揭晓获奖团队:太空探测10分钟发现野火,无人机灭火仍未能扑灭
总额1100万美元的 XPRIZE Wildfire 竞赛于9月23日公布获奖名单,两个大奖均空缺。
Runway:News(网页)精选AI 评分6262 Runway 发布 DaVinci Resolve 插件,可在剪辑软件内生成和重绘素材
Runway 发布 DaVinci Resolve 插件,可在 Resolve Studio 内直接生成图像和视频、重绘播放头下的片段,并将结果导入媒体池和时间线。
推荐理由:官方发布说明讲清了插件的核心工作流变化和版本要求,剪辑师可以据此评估是否把生成环节搬进 Resolve。
The Decoder:AI News(RSS)AI 评分7070 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,可用文字描述从零设计 AI 语音
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音生成模型,支持 100 多种语言,Flash TTS 可通过文字描述从零设计语音,并支持 30 秒样本的声音克隆(需录制同意声明),生成内容带 SynthID 水印。
Hacker News:AI 热帖AI 评分6969 Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒音频样本复刻声音、逐行台词表演控制、原生双说话人场景编排,覆盖超过 100 种语言和方言。
World Labs@theworldlabsAI 评分1919The Decoder:AI News(RSS)AI 评分5757 YouTube 在 Creator Studio 推出 AI 工具,涵盖脚本辅导、智能缩略图和 Gemini 剪辑
YouTube 向创作者推出多项 AI 工具。YouTube Studio 内的故事助手可分析脚本和粗剪,给出节奏、结构与叙事建议,支持最多三个剪辑版本 A/B 测试;动态缩略图会为不同观众自动展示三张预览图中最合适的一张。
IT之家(RSS)AI 评分5353 YouTube 在 Made on YouTube 活动上推出帮助创作者优化频道的 AI 智能体
YouTube 在 9 月 23 日的年度创作者活动 Made on YouTube 上宣布升级 2025 年推出的 AI 创作工具,推出一款帮助创作者在后台优化频道的智能体。
The Verge:AI(RSS)AI 评分5959 YouTube 在 Made on YouTube 大会发布后台 AI 智能体等创作者工具
YouTube 在年度 Made on YouTube 活动上宣布升级其 AI 创作者工具套件,引入一个在后台优化频道的 AI 智能体,可监测旧视频的新热度并建议修改缩略图和标题,还能整理频道受众数据生成品牌提案。
TechCrunch:AI(RSS)AI 评分6363 YouTube 在 Made on YouTube 活动上为 Studio 应用推出多项 AI 功能
YouTube 在年度 Made on YouTube 活动上宣布为 YouTube Studio 推出多项 AI 功能。包括将 AI 问答功能 Ask Studio 扩展到 iOS 和 Android、对未发布视频草稿提供节奏和叙事建议、按视频内容生成匹配创作者风格的缩略图和标题、以及可向不同受众群体展示三种选项的动态缩略图。
TechCrunch:AI(RSS)AI 评分6565 YouTube 推出 AI 自定义推荐流功能 custom feeds
YouTube 宣布推出名为 custom feeds 的新功能,用户可在提示词框中用自然语言描述想看的视频类型,由 Gemini 生成定制推荐流并置顶在首页独立标签中。
Qwen@Alibaba_QwenAI 评分6565Qwen 发布 Qwen Intelligence,推出三款移动端智能体:Mobile Planner Agent 规划与编排复杂任务,在 MobilePA-Bench。
IT之家(RSS)AI 评分6161 微软 Win11 Clipchamp 新增本地 AI 视频超分功能,可将视频分辨率提升至 4K
微软为 Windows 11 内置视频编辑器 Clipchamp 新增视频超分辨率功能,可利用本地算力将低分辨率视频提升至最高 4K。支持硬件包括 CPU,Copilot+ PC 可用 NPU,兼容 AMD、英特尔和高通硬件,仅限 Windows 桌面版,浏览器版暂不支持。微软提醒 AI 生成的细节可能出现伪影或失真,不建议用于法律证据、身份验证和医学影像等敏感场景。
HuggingFace Daily Papers(社区热门论文)AI 评分3333 EmbodiedMemory-Bench:面向长时程具身任务的具身记忆基准测试
研究者提出 EmbodiedMemory-Bench(EMem-Bench),包含 4 类任务家族共 2,554 个交互 episode,要求智能体从交互历史中构建并更新记忆,再据此在环境中完成后续任务。
IT之家(RSS)AI 评分5858 高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 StepEdge-Omni 30B-MoE 模型
2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版端侧适配阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示智能体助手。
TechCrunch:AI(RSS)AI 评分5454 Qualcomm 发布 Snapdragon 8 Elite Gen 6 与 Extreme Gen 6 两款 AI 旗舰手机芯片
Qualcomm 在年度 Snapdragon Summit 上发布 Snapdragon 8 Elite Gen 6 和 Snapdragon 8 Elite Extreme Gen 6 两款旗舰手机芯片,主打 AI 功能。
Artificial Analysis@ArtificialAnlysAI 评分5252
StepFun@StepFun_aiAI 评分5959
IT之家(RSS)AI 评分5858 Adobe Premiere 移动版登陆谷歌 Play 商店,安卓手机可免费剪辑并导出 4K 视频
Adobe Premiere 移动应用 9 月 22 日正式登陆安卓平台,此前 iOS 版已上线一年多,应用可免费下载。分割、修剪、合并、调速度、加文字和旁白等剪辑功能免费,无需付费即可不限次数导出无水印 4K 视频;音效创建和 Adobe Firefly AI 生成素材等需购买生成式 AI 点数,后续还将加入 Adobe Fonts、增强型字幕和与桌面版无缝衔接功能。
IT之家(RSS)AI 评分5252 奥地利科学院联合 Mistral 发布古希腊语大语言模型 Apollo,用于修复莎草纸残片
奥地利科学院联合 Mistral 和 Sail Reply 开发的大语言模型 Apollo 将于当地时间周三正式发布,面向古希腊语文献修复,训练素材涵盖手稿、莎草纸与石刻铭文,总计约 6 亿个古希腊历史词汇。
Hacker News:AI 热帖AI 评分6262 MiMo-V2.6-Pro 智能水平、性能与价格分析
Artificial Analysis 页面显示,小米的 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得分 46,远高于同类开源权重模型中位数 18。
IT之家(RSS)AI 评分5656 Omdia:全球 AI 眼镜 2026H1 出货 420 万副,同比增长 127%
Omdia 数据显示,全球 AI 眼镜 2026 年上半年出货 420 万副,同比增长 127%,增长主要由 Meta 动能和中国市场推动。Meta 以 340 万副占 81.3% 份额,Even Realities 以 2.4% 居第二;中国出货同比激增 306%,市场高度分散,阿里巴巴、影目、小米合计市占仅 46.1%。
IT之家(RSS)AI 评分5959 阿里千问办公发布企业上下文、数字员工及 Agent 硬件 QwenNote A2
阿里千问办公(QwenWork)在 2026 云栖大会专场发布企业级 Agent 系列产品,包括企业上下文(Enterprise Context)、数字员工、协作与应用功能,以及安全中心。同时发布首款 Agent 硬件 QwenNote A2,支持语音转写与语音调用千问办公执行任务,转写仅保留文字和纪要、不保留原始音频,售价 1199 元,当日开售。