#多模态
#多模态
今日 4 条
-Zho-@ZHO_ZHO_ZHOAI 评分4040
Sherwin Wu@sherwinwuAI 评分7878
-Zho-@ZHO_ZHO_ZHOAI 评分4747
-Zho-@ZHO_ZHO_ZHOAI 评分3535
OpenAI Developers@OpenAIDevsAI 评分6363OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
Google Research:Blog(网页)精选AI 评分6666 Google 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
Runway@runwaymlAI 评分6363
Google AI@GoogleAIAI 评分5555
The Verge:AI(RSS)AI 评分5959 Google 发布 AI 天气模型 WeatherNext 3,引入实时卫星观测
Google 推出更新的 AI 天气模型 WeatherNext 3,可基于实时卫星观测每小时生成一次预报,全球分辨率较上一代提升五倍。相较 WeatherNext 2 的 6 小时一次、25 公里网格,新模型对温度和湿度等变量最高达 5 公里分辨率,提前一天以上的降水预报准确率最高提升 50%,在雨量计较少的美国和欧洲以外地区改进最大。
IT之家(RSS)AI 评分5454 HTC 推出 AI 智能眼镜 VIVE Eagle,主打隐私保护,499 美元起
HTC 宣布 AI 智能眼镜 VIVE Eagle 正式登陆欧洲、北美和澳大利亚市场,即日起通过 vive.com 等渠道开放订购,起售价 499 美元。
IT之家(RSS)AI 评分5151 沙特 HUMAIN 发布前沿阿语模型 humain-m3,由 MiniMax 受托开发
沙特 PIF 旗下 AI 企业 HUMAIN 公布前沿阿拉伯语模型 humain-m3,由 MiniMax 受托开发。该模型基于 MiniMax-M3 构建,进行了 T 级阿拉伯语原生文本 Token 规模的预训练,在 7 个公开阿拉伯语基准测试中取得参测前沿模型的最高平均分。模型已在 HUMAIN Node 平台以研究和评估预览版本提供,后续将发布开放权重版本。
IT之家(RSS)AI 评分5656 谷歌 DeepMind 发布 WeatherNext 3:分辨率最高 5 公里的 AI 天气预报模型
谷歌 DeepMind 和 Google Research 发布 WeatherNext 3,称其为最先进、最准确的全球气象模型。模型基于原始卫星数据和稀疏气象站观测训练,可每小时生成一次预报,地表关键变量分辨率达 5 公里,并新增针对可再生能源的 100 米高度风速、云量和太阳辐射预测。即日起为谷歌搜索、Gemini 应用、谷歌地图、地图平台气象 API 和 Earth Engine 提供支持。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。
推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。
IT之家(RSS)AI 评分4444 我国推进新一代全火星地质图编制,计划2028年底完成1:500万比例1.0版
据新华社报道,天问三号任务首席科学家侯增谦院士透露,我国正以数据驱动、智能编图为理念推进新一代全火星地质图编制,融合天问一号探测数据与多源国际数据的影像、光谱、雷达、重力等信息,引入人工智能技术实现智能地质解译,计划2028年底完成1:500万全火星地质图1.0版。
Hugging Face:Blog(RSS)AI 评分5454 NeoMME 发布 260M 与 800M 多语言多模态编码器,权重以 Apache 2.0 开源
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
MiniMax (official)@MiniMax_AIAI 评分3838IT之家(RSS)AI 评分6565 达拉斯用垃圾车 AI 摄像头为房产打破败评分,已发现超 2.1 万处疑似违规
达拉斯市在垃圾清运车上部署 AI 摄像头,按违规严重程度给房产打 1 至 4 分的破败评分,已在超过 2.1 万处房产发现至少一项疑似违规,并已发出 1800 份提醒通知,计划每年发出约 5200 份。当地共投用 100 台 1920×1080 摄像头,安装在 50 辆清运车上,约每 30 天扫描全市一次;居民担忧隐私和罚款负担,City Detect 表示系统会对人脸和车牌模糊处理。
Baidu Inc.@Baidu_IncAI 评分2929
Frank Wang 玉伯@lifesingerAI 评分2323公众号:小红书技术(dots.llm)AI 评分5555 小红书与 vivo 联合打通 3D 图片全链路技术实践
小红书与 vivo 联合打通从 vivo 相册生成 3D 图到小红书发布、分发与消费的完整 3D 内容链路,并共同设计面向移动社交场景的新型 3D 格式。
IT之家(RSS)AI 评分3434 小米澎湃 HyperOS 4 超级小爱升级跨设备协作,支持手机、电脑对话同步
小米介绍澎湃 HyperOS 4 超级小爱跨设备协作升级,支持手机、电脑对话同步,换台设备还能接着聊,也可用手机一句话找到电脑文件、跨设备接续任务。海报显示 Windows 和 macOS 也可使用超级小爱 2.0,需电脑或平板下载最新版小米互联服务应用并登录同一小米账号,超级小爱需升级至 8.1 版本及以上并开启专家模式。
公众号:面壁智能(MiniCPM)AI 评分6060 开发者基于 MiniCPM-o 4.5 打造本地全模态桌面 Agent AI Jarvis 并开源
林亦团队在 NVIDIA 与抖音平台联合创作合作中,基于 MiniCPM-o 4.5 的低延迟全双工能力打造了本地全模态桌面 Agent AI Jarvis,并开源在 https://github.com/LYiHub/pub-local-jarvis。
公众号:龙猫LongCat(美团)AI 评分4040 美团智播解析数字人直播技术:形象生成、动作驱动与万路并发方案
美团智播官方发布技术长文,介绍AI数字人直播的完整技术闭环,涵盖高保真形象生成与编辑(SDIP、SREdit)、文本驱动动作生成(MoTiGA)、语音手势协调生成(StreamingTalk)和视觉token压缩推理加速(Glance2Gaze)。
Artificial Analysis@ArtificialAnlysAI 评分7070Qwen:Blog Retrieval(API)AI 评分4545 Qwen 发布 Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型
Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。
IT之家(RSS)AI 评分5454 戚薇回应 AI 授权"卖脸"争议:更愿意"主动出击",数字分身将主演 AI 漫剧《末日盛夏》
戚薇在《中国新闻周刊》9 月 2 日报道的采访中回应"卖脸"争议,称其数字分身授权是有期限、有范围、有审核和追责的,且只开放给合作的影视项目,而非向所有人开放。她的数字分身将主演末世 AI 漫剧《末日盛夏》,主角名为"韩清夏"。她表示规范授权是把合法使用与非法使用区分开,并认为真人戚薇和数字形象应成为两条独立又协同的创作线。
IT之家(RSS)AI 评分4444 NJIT 团队发布 EarlyDetect 模型,提前 9.24 小时捕捉太阳活动区信号
美国新泽西理工学院(NJIT)牵头的科研团队发布机器学习模型 EarlyDetect,可从太阳声学活动和磁场变化中识别活动区形成前兆,性能最佳的版本平均提前 9.24 小时识别信号。
Artificial Analysis@ArtificialAnlysAI 评分5353
DogeDesigner@cb_dogeAI 评分4242Grok Imagine 新增 Draw 功能,用户在菜单中选择 Draw 后画出任意内容,Grok 可在几秒内将其生成图像。作者称该功能适合儿童使用,并形容创造力因此成为超能力。
jason@jxnlcoAI 评分3737独立创作者 @covacut 宣布在经历一年独立创作后加入 OpenAI,称想扩展谁有资格去想象以及什么成为可能。她邀请艺术家、故事讲述者和创作者与她联系;Jason Liu 转发表示很高兴与她合作。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5757 Anthropic 上线 Claude 生成文件检测工具
Anthropic 上线检测文件是否由 Claude 生成的浏览器工具,文件不上传、仅读取本地嵌入的内容凭证。工具识别基于 C2PA 开放行业标准的加密签名元数据,支持 .png、.jpg、.svg 等文件类型,文本水印检测则通过面向合格机构的私有预览 Detection API 提供。
Rohan Paul@rohanpaul_aiAI 评分3535Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 Google DeepMind 发布 Gemini 3.8 Flash 模型卡
Google DeepMind 发布 Gemini 3.8 Flash 模型卡,称其为 Gemini 3.7 Flash 的下一代迭代,在软件工程和智能体知识工作流方面提升性能,并继续支持自定义 effort 等级以平衡质量、成本和延迟。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准
DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。
OpenRouter@OpenRouterAI 评分5757The Verge:AI(RSS)AI 评分3838 Google 与 MrBeast 达成多年合作,Gemini 将进入其荒野生存视频
Google 与 MrBeast 达成多年合作,MrBeast 将在后续视频中展示 Gemini、Google Health 和 Fitbit Air。首支视频定于 9 月 5 日发布,Jimmy Donaldson 和团队将穿越丛林、沙漠和北极三种极端环境,借助 Gemini 识别危险、应对剧烈天气变化。
Google DeepMind精选AI 评分7474 WeatherNext 3 发布,天气 AI 接入搜索、地图和开发者数据服务
WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。
推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。
LlamaIndex:产品、工程与评测AI 评分5656 LlamaIndex 发布 Turbo 抽取档位,中位速度每页 3.7 秒
LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。
Josh Woodward@joshwoodwardAI 评分5959Artificial Intelligence News(网页)AI 评分3434 Motional 与 MIT 合作研究让自动驾驶汽车实时解释决策
Motional 与 MIT 研究人员构建了一套让自动驾驶汽车实时解释自身决策的系统,旨在解决自动驾驶 AI 的黑箱问题。该成果发表于 Nature,团队包括 Motional CEO Laura Major 与 MIT 计算机科学与人工智能实验室的研究人员。