#多模态
#多模态
今日 4 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分7676IT之家(RSS)AI 评分8686 DeepSeek 发布 V4.1 Flash 模型,基准超越 V4 Pro 并下调 API 定价
深度求索正式发布 DeepSeek V4.1 Flash,为 552B 参数 MoE 模型,采用全新 Causal-Encoder-Decoder 结构,原生支持多模态,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
DeepSeek:API 更新日志精选AI 评分8080 DeepSeek 发布 V4.1-Flash,API 价格同步下调
DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。
推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。
公众号:DeepSeek(深度求索)AI 评分8686 DeepSeek 发布 V4.1 Flash:552B MoE 多模态模型,同步开源并下调 API 定价
DeepSeek 正式发布 V4.1 Flash,全新 Causal-Encoder-Decoder 结构的 552B 参数 MoE 模型,输入激活 8B、输出激活 16B,具备原生多模态视觉理解,基准测试超越包括 DeepSeek V4 Pro 在内的旗舰模型。
IT之家(RSS)AI 评分6969 DeepSeek 合并快速、专家、识图模式为统一智能模式,V4.1 Flash 最快今日发布
DeepSeek 宣布将快速模式、专家模式和识图模式合并为统一的智能模式,模型可自动检测查询复杂度、在检测到图片输入时激活视觉能力并按任务难度调整处理能力。
Suno@suno精选AI 评分6666Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
HuggingFace Daily Papers(社区热门论文)AI 评分5858 Vidu S2 发布:实时交互、可编辑的空间视频生成
Vidu 团队发布 Vidu S2,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing,并探索了二者的实时空间视频生成。
The Verge:AI(RSS)AI 评分5555 Apple 推出 Reference Image 功能,用 iPhone 18 Pro 新传感器为照片签名防 AI 篡改
Apple 将随 iPhone 18 Pro 系列推出 Reference Image 功能,利用新相机传感器对 Reference 模式下拍摄的每个像素签名,经 Private Cloud Compute 生成不可更改的参考图像,可在 Photos 应用中与其他版本对比以发现编辑痕迹。
TechCrunch:AI(RSS)AI 评分5858 TechCrunch 分析 Apple Watch 新 AI 音频功能如何让技术常听成为常态
TechCrunch 分析 Apple 在 iPhone 发布会上推出的 Apple Watch 音频智能功能,认为这些功能正在让用户接受技术随时在听的现实。Live Rewind 可双击数字表冠回溯 15 秒并转写刚说过的话,转写文本可存入新的独立 Siri 应用;Siri Recap 通过环境监听生成对话的标题、摘要和要点,不保存音频、不识别说话人并采用端到端加密。
Apple:Newsroom(RSS)精选AI 评分6666 Apple 发布首款折叠屏 iPhone Duo,起售价 $1,999
Apple 发布首款折叠屏 iPhone Duo,展开为 7.6 英寸内屏,合盖后为 5.4 英寸外屏,提供 iPhone 上最大显示面积。搭载 A20 Pro 芯片和蒸汽室散热,iPhone 17 Pro 续航最高 44 小时视频播放,10 月 16 日开启预购、10 月 23 日发售,起售价 $1,999。
推荐理由:官方完整披露了屏幕、铰链、A20 Pro、续航与售价等参数,读者可据此评估这款折叠 iPhone 的实际取舍。
TechCrunch:AI(RSS)AI 评分5454 Apple 推出 Reference Image 功能验证 iPhone 18 Pro 照片真实性
Apple 在 Surprise and Shine 活动上发布 Apple Reference Image 功能,用于验证 iPhone 18 Pro 拍摄照片是否真实。
IT之家(RSS)AI 评分5555 苹果发布全新 Siri AI,支持中文但首发无缘中国大陆
苹果在 2026 秋季新品发布会上发布全新 Siri AI,计划支持英语、简体中文、繁体中文等 16 种语言,但首发不支持中国大陆使用。Siri AI 已以英语推出 Beta 版,10 月将支持法语、日语、韩语、葡萄牙语和西班牙语等;首发功能较基础,包括拼写纠正、拍照问 Siri AI、照片 AI 消除改变空间视角等。
Ant Ling@AntLingAGIAI 评分5151蚂蚁百灵发布 Ling-3.0-flash-VL,并与 Day-0 合作伙伴 Novita 同步上线,限时免费 14 天。
Ant Ling@AntLingAGIAI 评分5252Google Blog:AI(RSS)AI 评分5252 Google DeepMind 参与纪录短片 Love, Rendered 用影像技术重现褪色的记忆
Google 发布纪录短片 Love, Rendered,讲述结婚超过 70 年的 Burt 和 Ethelle Shatz 应对 Burt 认知衰退的故事,用技术重现未曾被拍摄的记忆,包括两人在克利夫兰学生合作社相遇的那一天。
DeepSeek 官方精选AI 评分8282 DeepSeek V4.1 Flash 发布,视觉理解进入默认 Flash API
DeepSeek 发布 V4.1 Flash,在新架构下加入原生视觉理解,并通过 deepseek-flash 接口提供。旧版 V4 Flash 与视觉实验版已退役,原名称暂时指向新版;公告还宣布下调 API 价格。本次发布没有提供可核实的权重开放信息。
推荐理由:原生视觉进入默认 Flash 接口,同时发生旧模型映射调整,使用方需要重新检查模型选择与多模态任务表现。
Cohere 产品与研究博客(网页)精选AI 评分6666 Cohere 发布开源权重翻译模型 North Small Translate,WMT26 得分 83.60 超越 DeepL 与 Google Translate
Cohere 发布机器翻译模型 North Small Translate,为 MoE 架构,总参数 218B、激活 25B,支持 50+ 语言,WMT26 全语言得分为 83.60,高于 DeepL NextGen 的 81.37 和 Google Translate 的 68.20,Agentic 版本达 84.36。
推荐理由:官方公布了 WMT26 各语言和分区域得分、吞吐与单任务成本数据,读者可据此评估其相对 DeepL 和开源模型的位置。
The Decoder:AI News(RSS)AI 评分7272 Suno 发布与 Warner、BMG 和 Believe 合作的 v6 音乐模型
Suno 发布 v6 音乐模型,与 Warner Music、BMG 和 Believe 共同开发,并用 v6、v6-wild 和 v6-mini 三档替换全部旧模型,v6-mini 免费开放。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6969 Desert Ant Labs 发布 18 个可在设备上运行的专用小模型
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
TechCrunch:AI(RSS)AI 评分6464 Suno 发布用授权音乐训练的新模型 Suno v6,包含 base、wild、mini 三个版本
Suno 发布新模型家族 Suno v6,称其使用 Warner Music Group、BMG、Believe 等授权数据训练,不使用训练旧版模型的数据。模型分三档:面向付费用户的 base 版更可控,付费用户可用的 wild 实验版用于获取意外结果,mini 版更快并对所有用户开放;新模型支持用提示词编辑歌曲片段、以文本图片或视频为参考生成曲目,并可分离乐器采样制作节拍。
MiniMax Design (H3)@Hailuo_AIAI 评分2020IT之家(RSS)AI 评分6666 Suno 发布 v6 系列 AI 音乐模型,含 v6、v6-wild 和 v6-mini 三款
Suno 推出 v6 系列 AI 音乐模型,包含 v6、v6-wild 和 v6-mini 三款,并与华纳音乐、BMG 等唱片公司达成合作。v6 主打旗舰,v6-wild 面向实验性音乐,仅 v6-mini 向免费用户开放,另两款需 Pro 或 Premier 订阅。生成速度更快,几秒即可出音乐,支持自然语言编辑歌曲片段、从多个音频源生成混音、单独提取采样,并可从音频或图片等多模态输入生成歌曲。
IT之家(RSS)AI 评分5656 DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash,各项指标全面超越 V4 Pro
DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型,官方称经内外部多方测试,其在性能、费用、速度、总用时等指标上全面超越 V4 Pro。
Ant Ling@AntLingAGIAI 评分5555inclusionAI 在 ModelScope 发布开源视觉模型 Ling-3.0-flash-VL,采用 MIT 协议,提供 BF16 和 FP8 两种权重。
Ant Ling@AntLingAGIAI 评分5454HuggingFace Daily Papers(社区热门论文)AI 评分5757 Gander 全双工全模态交互智能体技术报告发布并开源
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 美国警方担心Meta智能眼镜被用于秘密录制警察与拘留设施
Guardian获得的十余份备忘录显示,从NYPD反恐部门到各地融合中心,美国执法机构担心Ray-Ban Meta眼镜被用来秘密录制警察和拘留设施,或协助恐袭前的踩点侦察。NYPD在1月发布备忘录要求检查在押人员眼镜,ICE在8月禁止员工在联邦工作场所佩戴。新奥尔良恐袭嫌犯案发前曾佩戴智能眼镜踩点,Meta回应称眼镜录制时有无法关闭的白色LED闪烁灯。
IT之家(RSS)AI 评分6262 蚂蚁百灵发布开源 Ling-3.0-flash-VL,首个原生多模态模型引入视觉反馈闭环
蚂蚁集团发布并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构,总参数 124B、单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token,并引入观察、行动、验证、修正的视觉反馈闭环机制。
公众号:蚂蚁百灵(Ling)AI 评分6565 蚂蚁百灵开源首个原生多模态大模型 Ling-3.0-flash-VL
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
OpenRouter:Announcements(RSS)精选AI 评分7171 OpenRouter 评测 Seedance 2.5:长镜头与已有素材编辑的场景及成本解析
OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。
推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。
OpenRouter:Announcements(RSS)精选AI 评分6464 OpenRouter 教程:用代码调用 Nano Banana 2 编辑图像
OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。
推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。
MarkTechPost(RSS)AI 评分5757 Google DeepMind 发布 AlphaGenome Atlas,为 90 亿个人类 DNA 变异提供预计算分子效应预测和 AVI 评分
Google DeepMind 发布 AlphaGenome Atlas,对人类基因组全部约 90 亿个单核苷酸变异预计算分子效应,形成 1 PB 数据集,规模超过 AlphaFold Database 的 30 倍。
Ant Ling@AntLingAGIAI 评分5252Hacker News 热门(buzzing.cc 中文翻译)AI 评分5252 Google DeepMind 发布 AlphaGenome Atlas 基因组变异数据库
Google DeepMind 发布 AlphaGenome Atlas,用 AlphaGenome 模型预先计算人类基因组全部 90 亿个单核苷酸变异的调控影响,形成 1 PB 数据集。
Demis Hassabis@demishassabisAI 评分5454Google DeepMind 发布 AlphaGenome Atlas,一个 AI 驱动的可搜索数据库,绘制全部 90 亿种单碱基 DNA 变异的预测影响,帮助科学家更好地理解疾病。
IT之家(RSS)AI 评分5454 谷歌 DeepMind 推出 AlphaGenome Atlas,覆盖人类基因组 90 亿种单核苷酸变异预测
谷歌 DeepMind 推出 AlphaGenome Atlas 平台,包含人类基因组约 90 亿种单核苷酸变异的功能预测,学术界可通过门户网站和 AlphaGenome API 免费使用。平台规模达 1 PB,比 AlphaFold 数据库大 30 倍以上,同时发布结合 AlphaGenome 与 AlphaMissense 预测的 AVI 评分,在多种变异致病性和罕见疾病基准测试中表现一流。
Google AI@GoogleAIAI 评分5656
Sundar Pichai@sundarpichaiAI 评分5454Google DeepMind:Blog(RSS)AI 评分5555 Google DeepMind 发布 AlphaGenome Atlas,绘制人类基因组单碱基变异预测图谱
Google DeepMind 发布 AlphaGenome Atlas,绘制了覆盖人类基因组中 90 亿个单碱基 DNA 变异分子效应的预测图谱。该图谱为研究基因变异的影响提供了系统性的预测资源。
The Verge:AI(RSS)AI 评分6161 Premiere 推出 Generative Media 工具,可在时间线内直接生成视频和音频
Adobe 为 Premiere 推出 Generative Media 工具,编辑可在项目时间线内高亮空缺直接生成视频、音效、音乐和声景,无需离开项目。