跳到正文

#多模态

今日 4 条
9月10日周四
  1. DeepSeek:API 更新日志80

    DeepSeek 发布 V4.1-Flash,API 价格同步下调

    DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

    推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。

  2. TechCrunch:AI(RSS)58

    TechCrunch 分析 Apple Watch 新 AI 音频功能如何让技术常听成为常态

    TechCrunch 分析 Apple 在 iPhone 发布会上推出的 Apple Watch 音频智能功能,认为这些功能正在让用户接受技术随时在听的现实。Live Rewind 可双击数字表冠回溯 15 秒并转写刚说过的话,转写文本可存入新的独立 Siri 应用;Siri Recap 通过环境监听生成对话的标题、摘要和要点,不保存音频、不识别说话人并采用端到端加密。

  3. Apple:Newsroom(RSS)66

    Apple 发布首款折叠屏 iPhone Duo,起售价 $1,999

    Apple 发布首款折叠屏 iPhone Duo,展开为 7.6 英寸内屏,合盖后为 5.4 英寸外屏,提供 iPhone 上最大显示面积。搭载 A20 Pro 芯片和蒸汽室散热,iPhone 17 Pro 续航最高 44 小时视频播放,10 月 16 日开启预购、10 月 23 日发售,起售价 $1,999。

    推荐理由:官方完整披露了屏幕、铰链、A20 Pro、续航与售价等参数,读者可据此评估这款折叠 iPhone 的实际取舍。

  4. IT之家(RSS)55

    苹果发布全新 Siri AI,支持中文但首发无缘中国大陆

    苹果在 2026 秋季新品发布会上发布全新 Siri AI,计划支持英语、简体中文、繁体中文等 16 种语言,但首发不支持中国大陆使用。Siri AI 已以英语推出 Beta 版,10 月将支持法语、日语、韩语、葡萄牙语和西班牙语等;首发功能较基础,包括拼写纠正、拍照问 Siri AI、照片 AI 消除改变空间视角等。

  5. DeepSeek 官方82

    DeepSeek V4.1 Flash 发布,视觉理解进入默认 Flash API

    DeepSeek 发布 V4.1 Flash,在新架构下加入原生视觉理解,并通过 deepseek-flash 接口提供。旧版 V4 Flash 与视觉实验版已退役,原名称暂时指向新版;公告还宣布下调 API 价格。本次发布没有提供可核实的权重开放信息。

    推荐理由:原生视觉进入默认 Flash 接口,同时发生旧模型映射调整,使用方需要重新检查模型选择与多模态任务表现。

  6. Cohere 产品与研究博客(网页)66

    Cohere 发布开源权重翻译模型 North Small Translate,WMT26 得分 83.60 超越 DeepL 与 Google Translate

    Cohere 发布机器翻译模型 North Small Translate,为 MoE 架构,总参数 218B、激活 25B,支持 50+ 语言,WMT26 全语言得分为 83.60,高于 DeepL NextGen 的 81.37 和 Google Translate 的 68.20,Agentic 版本达 84.36。

    推荐理由:官方公布了 WMT26 各语言和分区域得分、吞吐与单任务成本数据,读者可据此评估其相对 DeepL 和开源模型的位置。

9月9日周三
  1. TechCrunch:AI(RSS)64

    Suno 发布用授权音乐训练的新模型 Suno v6,包含 base、wild、mini 三个版本

    Suno 发布新模型家族 Suno v6,称其使用 Warner Music Group、BMG、Believe 等授权数据训练,不使用训练旧版模型的数据。模型分三档:面向付费用户的 base 版更可控,付费用户可用的 wild 实验版用于获取意外结果,mini 版更快并对所有用户开放;新模型支持用提示词编辑歌曲片段、以文本图片或视频为参考生成曲目,并可分离乐器采样制作节拍。

  2. IT之家(RSS)66

    Suno 发布 v6 系列 AI 音乐模型,含 v6、v6-wild 和 v6-mini 三款

    Suno 推出 v6 系列 AI 音乐模型,包含 v6、v6-wild 和 v6-mini 三款,并与华纳音乐、BMG 等唱片公司达成合作。v6 主打旗舰,v6-wild 面向实验性音乐,仅 v6-mini 向免费用户开放,另两款需 Pro 或 Premier 订阅。生成速度更快,几秒即可出音乐,支持自然语言编辑歌曲片段、从多个音频源生成混音、单独提取采样,并可从音频或图片等多模态输入生成歌曲。

  3. HuggingFace Daily Papers(社区热门论文)57

    Gander 全双工全模态交互智能体技术报告发布并开源

    作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。

  4. Hacker News 热门(buzzing.cc 中文翻译)67

    美国警方担心Meta智能眼镜被用于秘密录制警察与拘留设施

    Guardian获得的十余份备忘录显示,从NYPD反恐部门到各地融合中心,美国执法机构担心Ray-Ban Meta眼镜被用来秘密录制警察和拘留设施,或协助恐袭前的踩点侦察。NYPD在1月发布备忘录要求检查在押人员眼镜,ICE在8月禁止员工在联邦工作场所佩戴。新奥尔良恐袭嫌犯案发前曾佩戴智能眼镜踩点,Meta回应称眼镜录制时有无法关闭的白色LED闪烁灯。

  5. OpenRouter:Announcements(RSS)71

    OpenRouter 评测 Seedance 2.5:长镜头与已有素材编辑的场景及成本解析

    OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。

    推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。

  6. OpenRouter:Announcements(RSS)64

    OpenRouter 教程:用代码调用 Nano Banana 2 编辑图像

    OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。

    推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。

9月8日周二
  1. IT之家(RSS)54

    谷歌 DeepMind 推出 AlphaGenome Atlas,覆盖人类基因组 90 亿种单核苷酸变异预测

    谷歌 DeepMind 推出 AlphaGenome Atlas 平台,包含人类基因组约 90 亿种单核苷酸变异的功能预测,学术界可通过门户网站和 AlphaGenome API 免费使用。平台规模达 1 PB,比 AlphaFold 数据库大 30 倍以上,同时发布结合 AlphaGenome 与 AlphaMissense 预测的 AVI 评分,在多种变异致病性和罕见疾病基准测试中表现一流。