跳到正文

#多模态

今日 4 条
9月4日周五
  1. -Zho-40

    ZHO 刷了大量 GPT-6 Astra 提前测试案例后评价,其惊艳点在于通过建模/渲染软件实现高质量 3D 建模和渲染,建筑与游戏均适用。作为职业建筑师,他认为这并不惊艳,早在 2023 年就提出 AI 能生成真实照片后就不再需要效果图;如果 GPT-6 真的足够强,应重建全新的工作逻辑和链路,而不是更好地完成旧链路,那才是迈向 AGI 的起点。

  2. Google Research:Blog(网页)66

    Google 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。

    推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。

9月3日周四
  1. The Verge:AI(RSS)59

    Google 发布 AI 天气模型 WeatherNext 3,引入实时卫星观测

    Google 推出更新的 AI 天气模型 WeatherNext 3,可基于实时卫星观测每小时生成一次预报,全球分辨率较上一代提升五倍。相较 WeatherNext 2 的 6 小时一次、25 公里网格,新模型对温度和湿度等变量最高达 5 公里分辨率,提前一天以上的降水预报准确率最高提升 50%,在雨量计较少的美国和欧洲以外地区改进最大。

  2. IT之家(RSS)51

    沙特 HUMAIN 发布前沿阿语模型 humain-m3,由 MiniMax 受托开发

    沙特 PIF 旗下 AI 企业 HUMAIN 公布前沿阿拉伯语模型 humain-m3,由 MiniMax 受托开发。该模型基于 MiniMax-M3 构建,进行了 T 级阿拉伯语原生文本 Token 规模的预训练,在 7 个公开阿拉伯语基准测试中取得参测前沿模型的最高平均分。模型已在 HUMAIN Node 平台以研究和评估预览版本提供,后续将发布开放权重版本。

  3. IT之家(RSS)56

    谷歌 DeepMind 发布 WeatherNext 3:分辨率最高 5 公里的 AI 天气预报模型

    谷歌 DeepMind 和 Google Research 发布 WeatherNext 3,称其为最先进、最准确的全球气象模型。模型基于原始卫星数据和稀疏气象站观测训练,可每小时生成一次预报,地表关键变量分辨率达 5 公里,并新增针对可再生能源的 100 米高度风速、云量和太阳辐射预测。即日起为谷歌搜索、Gemini 应用、谷歌地图、地图平台气象 API 和 Earth Engine 提供支持。

  4. Google DeepMind:Blog(RSS)70

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。

    推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。

  5. IT之家(RSS)44

    我国推进新一代全火星地质图编制,计划2028年底完成1:500万比例1.0版

    据新华社报道,天问三号任务首席科学家侯增谦院士透露,我国正以数据驱动、智能编图为理念推进新一代全火星地质图编制,融合天问一号探测数据与多源国际数据的影像、光谱、雷达、重力等信息,引入人工智能技术实现智能地质解译,计划2028年底完成1:500万全火星地质图1.0版。

  6. IT之家(RSS)65

    达拉斯用垃圾车 AI 摄像头为房产打破败评分,已发现超 2.1 万处疑似违规

    达拉斯市在垃圾清运车上部署 AI 摄像头,按违规严重程度给房产打 1 至 4 分的破败评分,已在超过 2.1 万处房产发现至少一项疑似违规,并已发出 1800 份提醒通知,计划每年发出约 5200 份。当地共投用 100 台 1920×1080 摄像头,安装在 50 辆清运车上,约每 30 天扫描全市一次;居民担忧隐私和罚款负担,City Detect 表示系统会对人脸和车牌模糊处理。

  7. Frank Wang 玉伯23

    YouMind 负责人玉伯称收到两例用户反馈,印证产品差异化:一是 All-in-One 创作工作室带来便捷,用户认为单工具比多工具方便;二是生图、生 PPT、生视频功能持续解决人物、风格等一致性问题,让 Lovart、LibTV 用户愿意迁移到 YouMind。附图为一封用户来信,称赞无需切换标签页即可完成研究、写作和生成视觉素材。作者表示打磨过程辛苦,但看到用户反馈和付款感到开心。

  8. IT之家(RSS)34

    小米澎湃 HyperOS 4 超级小爱升级跨设备协作,支持手机、电脑对话同步

    小米介绍澎湃 HyperOS 4 超级小爱跨设备协作升级,支持手机、电脑对话同步,换台设备还能接着聊,也可用手机一句话找到电脑文件、跨设备接续任务。海报显示 Windows 和 macOS 也可使用超级小爱 2.0,需电脑或平板下载最新版小米互联服务应用并登录同一小米账号,超级小爱需升级至 8.1 版本及以上并开启专家模式。

  9. Artificial Analysis70

    Artificial Analysis 评测显示,阿里巴巴 Wan 3.0 在视频编辑带音频榜单首次登顶第一,文生视频带音频位列第二,图生视频带音频排名第五。该模型为一体化视频生成与编辑模型,支持最长 30 秒 1080p 原生音频输出,可接受文本、图片、视频、音频、文档和网页作为创作参考,并支持指令式编辑画面、剧情、对话和声音。

  10. IT之家(RSS)54

    戚薇回应 AI 授权"卖脸"争议:更愿意"主动出击",数字分身将主演 AI 漫剧《末日盛夏》

    戚薇在《中国新闻周刊》9 月 2 日报道的采访中回应"卖脸"争议,称其数字分身授权是有期限、有范围、有审核和追责的,且只开放给合作的影视项目,而非向所有人开放。她的数字分身将主演末世 AI 漫剧《末日盛夏》,主角名为"韩清夏"。她表示规范授权是把合法使用与非法使用区分开,并认为真人戚薇和数字形象应成为两条独立又协同的创作线。

  11. Hacker News 热门(buzzing.cc 中文翻译)57

    Anthropic 上线 Claude 生成文件检测工具

    Anthropic 上线检测文件是否由 Claude 生成的浏览器工具,文件不上传、仅读取本地嵌入的内容凭证。工具识别基于 C2PA 开放行业标准的加密签名元数据,支持 .png、.jpg、.svg 等文件类型,文本水印检测则通过面向合格机构的私有预览 Detection API 提供。

  12. Rohan Paul35

    Rohan Paul 转评 @MeetResona 团队推出的直播 AI Agent Resona,该产品面向创作者和教育者,把现有材料变成可实时互动的直播会话。作者认为 Resona 把文档当作 Agent 的知识边界,创作者设定交互目标,Agent 沿方向主动推进讲解,不同于由用户提问驱动的普通文档聊天机器人;引用内容还提到支持 36 种语言切换、可自定时长与定价或免费提供。

  13. HuggingFace Daily Papers(社区热门论文)40

    DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准

    DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。

  14. Google DeepMind74

    WeatherNext 3 发布,天气 AI 接入搜索、地图和开发者数据服务

    WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。

    推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。

  15. LlamaIndex:产品、工程与评测56

    LlamaIndex 发布 Turbo 抽取档位,中位速度每页 3.7 秒

    LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。

9月2日周三