#多模态
#多模态
今日 4 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分5656
Rohan Paul@rohanpaul_aiAI 评分6363Apple:Newsroom(RSS)精选AI 评分7777 Apple 发布新一代 Apple Intelligence,Siri AI 正式以测试版上线
Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。
推荐理由:官方公告完整列出 Siri AI 的能力清单、设备与语言范围,以及欧盟和中国市场暂不可用等限制,读者可据此评估适用性。
Apple:Newsroom(RSS)AI 评分7171 Apple 发布 iOS 27、iPadOS 27、macOS 27 等系统更新,推出 Siri AI 与新一代 Apple Intelligence
Apple 开始推送 iOS 27、iPadOS 27、macOS 27、watchOS 27、visionOS 27 和 tvOS 27 更新,引入基于新一代 Apple Intelligence 的 Siri AI。
TechCrunch:AI(RSS)AI 评分7676 iOS 27 实测:基于 Gemini 的新 Siri 让作者重新用上 Siri
TechCrunch 作者实测 iOS 27 公测版后表示重新使用 Siri,新版 Siri 基于 Google Gemini 模型构建,可处理多步指令、读取屏幕上下文、调用相机回答所见物体并支持草拟发送消息。
Google AI@GoogleAIAI 评分5454公众号:火山引擎AI 评分5757 AI导演DiDi_OK解密用Seedance 2.5制作科幻短片《Candy》的工作流
火山引擎采访AI导演DiDi_OK,介绍其完全用Seedance 2.5 720P制作的9分钟科幻短片《Candy》背后的制作过程。他称模型在精细定制化、运动规律理解和超长镜头一次生成上有突破,部分效果连续性超过传统CG;其工作流随之改变,提示词取代关键帧成为决定视觉上限的首要条件,世界观类叙事中分镜不再是必需。
MiniMax (official)@MiniMax_AIAI 评分6262
MiniMax (official)@MiniMax_AIAI 评分6161MiniMax 盘点其开源视频生成模型 MiniMax H3 的社区生态进展,该模型支持原生立体声音频和多模态参考控制。
公众号:京东JoyAIAI 评分5555 京东发布JoyAI-Echo 1.5并开源可交互视听世界模型EchoWM
京东探索研究院在9月9日JDD大会上发布JoyAI-Echo系列两项进展:超长音视频生成模型升级至JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型EchoWM。
MarkTechPost(RSS)AI 评分5252 基于 JAX3D 构建分层 NeRF 教程:体渲染、新视角合成与 3D 重建
该教程用 JAX、Flax、Optax 和 jax3d 的体渲染原语构建端到端分层 NeRF,包含位置编码、粗细双网络与 sample_piecewise_constant_pdf 重要性采样,并用 Adam、指数学习率衰减和梯度裁剪训练。评估涵盖 held-out PSNR、深度与透明度可视化、360 度渲染 GIF 以及 marching cubes 提取密度场等值面。
dex@dexhorthyAI 评分5353
The Decoder:AI News(RSS)AI 评分6060 ElevenLabs 发布 Music v2.5,开放应用与 API 并提供免费和 Pro 档位
ElevenLabs 为 ElevenMusic 发布 Music v2.5,称生成歌曲更饱满自然;在 47,885 组盲测对比中听众多数时候更偏好 v2.5,尤其是 R&B、Soul、Hip-Hop、Rock 和管弦乐。
OpenAI Developers@OpenAIDevsAI 评分8080OpenAI 开发者账号宣布发布 GPT-6 Astra,并汇总社区开发者基于它做出的构建案例,包括 2234 个建模解剖部件的 3D 展示、Unreal Engine 曼哈顿复刻。
Suno:Blog(网页)精选AI 评分6868 Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
公众号:生数科技(Vidu·视频)AI 评分5555 生数科技发布 Motus2:面向灵巧操作的自进化通用世界模型
生数科技发布面向机器人灵巧操作的世界模型 Motus2,将行动、预测、评估三种能力统一进同一个共享参数模型,形成生成动作、预测未来、评估结果、更新策略的闭环,并加入轻量触觉专家模块。
MeshyAI@MeshyAIAI 评分5353IT之家(RSS)AI 评分6363 微信测试图片 AI 处理功能,支持美化、修改与信息提取
微信在发送图片界面新增 AI 处理功能,点击后提供美化图片、修改图片、提取信息三类菜单,涵盖生成写真、消除杂物、扩图、变高清、提取文字、翻译图片等选项。此前微信已基于小微灰度上线至少 16 个 AI 功能,覆盖公众号 AI 总结、朋友圈 AI 点评与 AI 帮写、扫一扫视觉识别及聊天语音指令等场景,目前均处灰度测试阶段,仅部分用户可体验。
HuggingFace Daily Papers(社区热门论文)AI 评分5757 Realtime-Venus:支持异步委托的全双工交互系统
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
Artificial Analysis@ArtificialAnlysAI 评分6464
OpenRouter@OpenRouterAI 评分5454
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5151 YuE2 发布:融合象征性规划的音乐生成模型,SongBench 得分 6.9632 超越 Suno v5
YuE2 项目页发布音乐生成模型 YuE2,以可编辑符号乐谱为中间表示生成全曲音频。YuE2 (best-of-8) 在 WildSongBench (192 prompts) 的 SongBench 上得 6.9632,为 15 个设置中的最高观测均值,Suno v5 同对比得 6.8721。
OpenRouter@OpenRouterAI 评分5656IT之家(RSS)AI 评分5757 Arm 发布 CSS for Mobile 2 移动计算平台,面向智能体 AI
Arm 于 9 月 8 日在上海 Arm Everywhere China 大会发布第二代移动计算子系统 CSS for Mobile 2,集成 C2 CPU 集群、Mali G2-Ultra NX GPU 和 SI L2 系统互连。
公众号:卡尔的AI沃茨精选AI 评分7676 实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
MiniMax Design (H3)@Hailuo_AIAI 评分4545IT之家(RSS)AI 评分5858 网易有道 OpenPods AI 耳机发售:获苹果 MFi 认证,首发 1499 元
网易有道 OpenPods AI 耳机已在京东发售,首发补贴后到手价 1499 元,定位首款专为 iPhone 用户打造的智能体耳机。
HuggingFace Daily Papers(社区热门论文)AI 评分5858 SenseNova-U1.5 发布:8B-MoT 原生统一多模态模型,支持 4K 生成与图像编辑
SenseNova 团队发布 SenseNova-U1.5,一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构内实现视觉理解、推理、生成和编辑。
Josh Woodward@joshwoodwardAI 评分6464
elvis@omarsar0AI 评分6969Pocket FM CEO Rohan Nayak 发文复盘公司从约 0 到 $500M ARR、年新增 $250M 且 EBITDA 盈利的增长打法。
🚨 AI News | TestingCatalog@testingcatalogAI 评分6363
Google Gemini@GeminiAppAI 评分5656Gemini 应用现已支持 Windows。用户按 Alt + Space 即可在常用工具旁唤起 Gemini,用于润色草稿、总结长文档、头脑风暴以及生成自定义图片和视频。
WorkBuddy@WorkBuddy_AI精选AI 评分7070推荐理由:WorkBuddy 官宣上线 DeepSeek V4.1-Flash 并给出两周免费入口,引用内容还说明了 V4-Pro 的退役与迁移安排。
SiliconFlow@SiliconFlowAIAI 评分6767IBM Research:AIAI 评分5454 IBM 与 NASA 开源月球基础模型 NASA-IBM Lunar Foundation Model
IBM 与 NASA 开源 NASA-IBM Lunar Foundation Model,整合美日多次探月任务的多模态、多分辨率观测数据。
Hugging Face:Blog(RSS)精选AI 评分6565 Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。
推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。
IT之家(RSS)AI 评分5656 理想汽车向 AD Max 车型推送马赫 VLA 2.0,覆盖近百万车主
理想汽车 CEO 李想宣布马赫 VLA 2.0 从 9 月 10 日起陆续推送至已交付 AD Max 的车型,覆盖近百万 Orin 和 Thor 平台车主。此次推送伴随 OTA 8.6 上线,经模型蒸馏和多轮验证完成多车型适配,同时新增 Livis 指挥泊车、大屏转向影像、艺术相框及新游戏等功能。
IT之家(RSS)AI 评分5656 高德发布 3D 原生城市世界模型 ABot-Earth 0.7,支持从星球到街景全尺寸生成
高德发布 3D 原生城市世界模型 ABot-Earth 0.7,称其为全球首个全模态、可预测的 3D 原生城市世界模型,覆盖超过 196 个国家和地区。模型可从卫星图像或文字描述出发,10 分钟内在一块消费级 GPU 上生成公里级 3DGS 格式城市场景,效率较传统模式提升 1000 倍,已应用于飞行街景 2.0,体验官网同步上线。
X.PIN@thexpinAI 评分5858
Thomas Wolf@Thom_WolfAI 评分7474DeepSeek 发布 DeepSeek-V4.1-Flash,称其为新架构家族中最小模型,具备原生视觉理解,面向更快推理、更高吞吐和扩展到更大模型而设计。