#多模态
#多模态
今日 4 条
Elon Musk@elonmuskAI 评分2020IT之家(RSS)AI 评分4040 Anthropic Claude iOS 应用接入苹果 CarPlay 支持车载语音对话
Anthropic 为 Claude iOS 应用加入苹果 CarPlay 支持,用户可通过车载信息娱乐系统与 Claude 进行免提语音对话。该功能无法控制车辆或 iPhone 上的其他功能,且 CarPlay 暂不支持第三方唤醒词,需先在 CarPlay 界面手动打开 Claude 应用。
IT之家(RSS)AI 评分3737 消息称苹果首款 AI 家用安防摄像头瞄准 2027 年发布,主打隐私保护
彭博社 Mark Gurman 爆料,苹果可能于 2027 年推出家庭安防系统及配套监控服务。摄像头主打隐私保护,不直接记录和分析实际视频,计划用 AI 监测环境,配备面部识别和红外传感器以识别房间内人员,实现如人离开自动关灯、播放家庭成员喜欢的音乐等智能家居自动化。
IT之家(RSS)AI 评分5252 谷歌 Gemini Spark 新增 Google Photos 照片库管理能力,支持自然语言编辑照片和整理相册
Google Photos 负责人 Shimrit Ben-Yair 宣布 Gemini Spark 支持管理 Google Photos 照片库,用户可用自然语言指令让 AI 智能体执行照片相关操作。
elvis@omarsar0AI 评分4242Elvis Saravia 推荐 arXiv 论文 Codebook Agent(arXiv:2609.02264,UCLA),研究发现多智能体系统经奖励筛选后拓扑收敛到约六种。
OpenAI Developers@OpenAIDevsAI 评分8181The Verge:AI(RSS)AI 评分4747 Roland 推出生成式 AI 音乐插件 Melody Flip
Roland 推出生成式 AI 音乐工具 Melody Flip,以 DAW 插件形式提供约 250 个按流派分类的 Palette 音乐素材库,可生成旋律、和弦进行、贝斯线或鼓点,也能基于参考曲目构建。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5353
Fei-Fei Li@drfeifeiAI 评分5757Fei-Fei Li 与 Justin Johnson、Ben Mildenhall、Martin Casado 在访谈中讨论 World Labs 新发布的空间智能世界模型 Atlas。
Google AI@GoogleAIAI 评分4646Google AI 发布本周产品盘点。Gemini 3.8 Flash 在编码、Agent 工作流和多步推理上升级;Gemini 3.8 Flash Cyber 主打漏洞检测与自动补丁。
Satya Nadella@satyanadellaAI 评分5050
Google Gemini@GeminiAppAI 评分4848Google 在 Gemini 中推出最先进音乐生成模型 Lyria 3.5,带来更丰富的编曲、更具表现力的人声和更高保真度。用户可选择音乐类型和人声或纯器乐,探索新模板,并生成较短或更长的曲目。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限
研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。
IT之家(RSS)AI 评分4444 长安发布自研天枢领航辅助驾驶,支持自然语言智驾指令与交警手势识别
长安汽车9月4日在科技生态大会上发布自研智能辅助驾驶方案“天枢领航”,支持“超过前方那辆车”等自然语言指令,覆盖高速NCA、城市NCA和全场景泊车三大功能域。
IT之家(RSS)AI 评分6262 微信开源多模态嵌入模型 WeMM-Embedding,含 2B/4B/9B 三个版本
微信 AI 宣布开源通用多模态嵌入模型 WeMM-Embedding,含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及交错多模态输入。模型基于 Qwen3.5 多模态架构,WeMM-Embedding-9B 在 MMEB-v2 榜单以 80.6 分位列第一;该模型已大规模部署于视频号、直播、公众号、电商与朋友圈的推荐与搜索系统,日调用量达 10 亿量级。
Frank Wang 玉伯@lifesingerAI 评分2424The Verge:AI(RSS)AI 评分6464 Instagram AI 内容标签再陷混乱,The Verge 实测发现只有 Meta 自家信号能触发标注
The Verge 记者实测发现,Instagram 的 AI Content 标签持续误标普通照片,而带 C2PA 和 SynthID 信号的 Gemini 完全生成图片反而未被标注。
SiliconFlow@SiliconFlowAIAI 评分6464HuggingFace Daily Papers(社区热门论文)AI 评分4949 长视频多模态模型视觉token分配受控研究:选择、压缩与再分配
arXiv 论文《Select, Compress, Reinvest》在固定评分器、分辨率策略与回答模型的前提下,逐一检验长视频 MLLM 的视觉token分配决策,覆盖六种免训练选择规则、三个长视频基准和两个回答模型。
IT之家(RSS)AI 评分3939 中国气象局气象智能预警方案"妈祖"埃及定制版开发取得阶段性进展
据央视新闻援引中国气象局 9 月 4 日消息,气象智能预警方案"妈祖"埃及定制版开发取得阶段性进展,系统平台数据清单梳理和埃及行政区划及地理信息系统数据接入均已完成。定制版面向当地需求设计了航空气象和文旅气象,前者为当地机场提供综合监测、关注要素预报及机场综合预警,后者包含星空观赏适宜度预报、沙尘暴预报预警和日出日落时间预报。下一步双方将研讨 AI 沙尘模式等专题模块建设。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 Scal3R 提出多相对位姿查询方法,提升长视频在线 3D 重建稳定性
Scal3R 将在线 3D 重建重新表述为多参考相对位姿查询,用约占参数 1% 的可学习 token 通过非对称注意力注入冻结骨干,并结合带回环闭合的在线位姿图优化抑制长程漂移。
IT之家(RSS)AI 评分6767 谷歌助理移动端 9 月 4 日起逐步停用,Gemini 全面接棒
谷歌于 9 月 4 日启动 Google Assistant 移动端退役,符合条件的安卓设备将自动切换至 Gemini,迁移在随后数周内分批完成,完成后无法切回。
-Zho-@ZHO_ZHO_ZHOAI 评分4343TechCrunch:AI(RSS)AI 评分4848 TechCrunch 解析 AI 生成菜单为何雷同难看:模型收敛与恐怖谷效应
TechCrunch 探讨餐厅 AI 生成菜单令人不适的雷同问题。Reality Defender CTO Alex Lisle 解释这是模型训练数据趋同导致的收敛而非模型崩溃,数据集为追求讨喜而同质化;Elon University 的 Lee Rainie 称 AI 会削平细节。德国杜伊斯堡-埃森大学研究发现 AI 食物图像呈现恐怖谷效应,看起来接近真实反而引发更多厌恶。
IT之家(RSS)AI 评分2929 摩尔线程“庐山”GPU 首发国产硬件光追,预计 2026 年底推出
摩尔线程在 2026 年半年度业绩说明会上表示,基于“花港”架构的“庐山”芯片预计 2026 年底推出,将实现 3A 游戏渲染提升 15 倍、AI 性能提升 64 倍、光线追踪性能提升 50 倍。该芯片的硬件光线追踪加速引擎支持 DirectX Raytracing (DXR),并配套全自研 MTAGR 1.0 AI 生成式渲染技术;具体销售时间以后续官方发布为准。
HuggingFace Daily Papers(社区热门论文)AI 评分3535 LatentStream:面向流式视频理解的渐进式潜在记忆演化框架
论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 Puffin-World 提出原生 3D 世界状态的统一多模态世界模型并开源
Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 WorldReward 提出面向相机条件世界模型的 VLM 奖励建模方法
WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 FlashRender:基于相机控制视频 MeanFlow 的少步生成渲染框架
论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。
IT之家(RSS)AI 评分4949 英伟达 DLSS 5 首发 RTX 50 系列,官方确认后续将扩展至 RTX 40 系列
英伟达 DLSS 5 正式上线,技术名称为 3D 引导神经渲染,首发仅支持 RTX 50 系列显卡且目前仅支持《NBA 2K27》。英伟达发言人 Rajal Maharaj 向 The Verge 确认,将在完成 RTX 50 系列优化后把官方支持扩展至 RTX 40 系列;RTX 30 和 20 系列尚未制定具体计划。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 LLaDA-Image 发布:用完全开放的训练配方构建强图像生成模型
LLaDA-Image 是一个统一框架,包含从零训练的 6B Diffusion Transformer 和基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块。
HuggingFace Daily Papers(社区热门论文)AI 评分5858 Principia 基准:通过成对物体的关系不变量评测视频模型的物理推理
论文提出 Principia 基准,用 529 个真实场景中的配对物体关系不变量评测视频生成模型和 VLM 的牛顿物理一致性,覆盖重力、摩擦、转动惯量等 8 种现象。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 CORE 论文提出用重排器蒸馏改进多模态嵌入的组合推理
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
MarkTechPost(RSS)AI 评分6565 Google DeepMind 发布 WeatherNext 3:基于气象站观测训练,提供每小时刷新的 5 km 全球预报
Google DeepMind 与 Google Research 发布 WeatherNext 3,以实时静止卫星拼图作为直接输入实现每小时初始化,输出精细至 0.05°(约 5 km)的预报,并直接用原始气象站观测训练专用输出头。
Ethan Mollick@emollickAI 评分2323
Ethan Mollick@emollickAI 评分5454IT之家(RSS)AI 评分4848 智谱 GLM Coding Plan 推出 GLM-5.3-Flash 夜间免费畅用活动,9 月 3 日至 20 日每晚 23 时至次日 9 时生效
智谱 AI 宣布 GLM Coding Plan 推出 Flash × ZCode 夜间畅用活动,即日起至 9 月 20 日每晚 23:00 至次日 9:00,付费套餐用户自动生效优惠。
IT之家(RSS)AI 评分3737 HTC 为 AI 智能眼镜 VIVE Eagle 新增圆框款式,录像升级 3K 并强化 AI 功能
HTC 为 AI 智能眼镜 VIVE Eagle 新增圆框款式,定价 15,600 新台币(约合 3,307 元人民币),提供炭黑、茶色、蓝色 3 种配色,可选 ZEISS 蔡司透明、太阳及变色镜片。
Artificial Analysis@ArtificialAnlysAI 评分6767Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。
jason@jxnlcoAI 评分1414Jason Liu 转发 OpenAI 的 @danielfradin 称其制作了一部自己最喜爱的影片,灵感来自经典影片 Put That There,并表示 Astra 的能力让他知道该怎么拍。