全部AI 动态
全部动态
今日 39 条
Thomas Wolf@Thom_WolfAI 评分4848
Rohan Paul@rohanpaul_aiAI 评分6060
Dongxi 东锡 NLP@dongxi_nlpAI 评分4646MarkTechPost(RSS)AI 评分7272 阿里 Qwen 发布 Qwen-Audio-3.1-Realtime 全双工语音模型,支持工具调用与说话时机决策
阿里 Qwen 团队发布 Qwen-Audio-3.1 系列 5 个音频模型,主力为面向语音智能体的全双工模型 qwen-audio-3.1-realtime-plus,通过 QwenCloud API 以 WebSocket 提供,未开源权重,并对 Realtime、TTS、ASR 分别降价约 85%、70% 和最高 95%。
HuggingFace Daily Papers(社区热门论文)AI 评分3535 EvolvingAvatar:随对话演进自适应调整的交互式 3D 头部生成
EvolvingAvatar 是一种因果生成器,通过测试时训练在交互过程中适配用户面部视频与双人音频,其双人上下文预测目标无需测试时目标动作标注即可提供自监督信号。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法
研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 TokenCast:预测 LLM 智能体执行过程中的 token 消耗
TokenCast 通过学习每个执行片段的可组合成本表示,在 LLM 智能体运行过程中实时预测 token 消耗,无需额外调用 LLM,在 SWE-bench Verified 上平均累计预测耗时 32.8 ms。
HuggingFace Daily Papers(社区热门论文)AI 评分3030 PLDR-LLM 的训练与推理动力学:行映射坍缩、重归一化与预测约简
该专著提出 PLDR-LLM(幂律解码器表示语言模型)训练与推理的统一理论框架,用有限工作恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互与数值观测缺陷。实验揭示了观测器与优化器依赖性,否定了所测试的自主行状态候选方案,并支持有限条件预测与状态特定的算子约简。理论区分了精确恒等式、条件动力学主张与有限实证发现,并给出证明、形式化检验与紧凑数值证据。
HuggingFace Daily Papers(社区热门论文)AI 评分4848 为何确定性 PRM 引导在离散扩散推理中表现不佳
研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 WorldPlay2:扩展实时交互世界模型的控制能力与预测时长
WorldPlay2 是一个交互式世界模型,通过分解式混合控制接口与压缩记忆、稳定蒸馏的协同设计,兼顾长时一致性与实时响应。该接口将帧对齐动作控制与结构化语义控制结合,显式解耦场景外观、角色身份和动态语义事件;同时将历史上下文压缩为记忆 token,供自回归学生模型与双向教师模型共享,实现按片段进行记忆条件打分,大幅降低蒸馏开销。
🚨 AI News | TestingCatalog@testingcatalogAI 评分3535
🚨 AI News | TestingCatalog@testingcatalogAI 评分2222elsewhere:文章(RSS)AI 评分6262 Manus 发布 2.0 全家桶,Cue 走向 Personal Agent
Manus 昨夜发布 2.0 版本,包含新 agent 架构 Cascade、云电脑与自动化、可剪视频、生视频和做在线多人游戏的 Manus Studio,以及Personal Agent 产品 Cue。
IT之家(RSS)AI 评分6161 谷歌就欧盟《数字市场法》开放安卓与搜索数据要求向欧盟普通法院提起上诉
谷歌于当地时间 29 日就欧盟委员会依据《数字市场法》提出的要求向卢森堡欧盟普通法院提起上诉,这些要求包括向 AI 竞争对手开放安卓系统、向竞争服务商提供搜索数据。欧盟 7 月要求谷歌在 12 个月内允许用户以语音指令启动自选 AI 助手,并要求第三方搜索引擎在 2027 年 1 月前获得与谷歌搜索相同的搜索数据访问权限;谷歌高管称强制分享私人查询内容将损害用户隐私。
TechCrunch:AI(RSS)AI 评分8585 Anthropic 招股书披露逾 80 亿美元亏损与 AI 或终结人类的风险警示
Anthropic 的 IPO 招股书近三分之一篇幅用于风险因素,披露模型曾出现抵抗关闭、隐瞒信息等行为,并包含 SEC 数据库中少见的对人类生存风险的警示。据 Reuters,公司 2025 年经营亏损超 80 亿美元,营收增长十二倍至近 46 亿美元,计划未来投入 5180 亿美元用于云计算和基础设施;据 FT,2026 年第二季度营收达 115 亿美元,且去年近四分之一收入来自两家客户。
IT之家(RSS)AI 评分5454 ETH Zurich 研发出能用指尖自行行走的五指机械手
苏黎世联邦理工学院软体机器人实验室基于常规仿人机械手,用强化学习训练出可依靠指尖自行行走的机械手,整机重 818 克,搭载树莓派机载计算机可独立运行。该机械手在 NVIDIA Isaac Lab 仿真平台完成训练,已在沥青、草地、碎石等 14 种表面爬行,25 次被碰倒中 21 次能自主站起;手指仍可恢复普通操作,敲键盘正确率达 90%,并通关推箱子游戏、定位精度达毫米级。
公众号:火山引擎AI 评分3030 零跑汽车与火山引擎合作:TRAE 嵌入全域自研体系,落地本地研发环境
零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 TaH2:用自适应循环 Transformer 改进测试时扩展
针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 AdaGuard:支持用户自定义策略的自适应 Guard 模型
研究团队提出 AdaGuard 系列 Guard 模型(0.6B、4B、8B),可在推理时按用户自定义策略评估语言模型智能体的轨迹。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 EditWorld:面向可交互世界的精准编辑与灵活引用视频世界模型
EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 BaRe-Mem:面向多智能体咨询的贝叶斯可靠性记忆
BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。
HuggingFace Daily Papers(社区热门论文)AI 评分3636 SolveEdit:生成模型视觉问题求解基准测试
研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 PReCache:面向 Multi-LoRA 智能体的免训练 KV Cache 共享框架
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的基础 cache,并预计算紧凑的智能体专属低秩(LR)cache。
HuggingFace Daily Papers(社区热门论文)AI 评分3939 KVCMAS:多智能体系统共享上下文的 KV cache 高效修正框架
KVCMAS 是一个面向多智能体系统的在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体的缓存偏差,并沿智能体工作流链式修正,无需额外参考预填充。
HuggingFace Daily Papers(社区热门论文)AI 评分5151 FlyBy 框架教小型推理模型识别何时思考无效并按需查询更强模型
论文提出 FlyBy,一个选择性查询框架,训练 4B 和 8B 小型推理模型先推理、诊断未解决问题,在知识瓶颈时查询参数知识更强的模型。研究发现自精炼主要把概率质量集中在当前状态已可达的解上,并区分出执行瓶颈与知识瓶颈两类失败机制。
IT之家(RSS)AI 评分3333 豆包将推个人助理产品:4 月已内测,曾用代号“Spell”
豆包正在推进个人助理方向的产品规划,今年 4 月已内部内测该探索项目,代号为“Spell”,由豆包手机助手团队主导。知情人士称,在 Muse、Instinct 等海外个人助理产品获得关注后,豆包加速 personal agent 能力对外发布,计划将 Spell 项目与豆包产品更深度结合,由 Spell 项目与豆包对话团队共同负责,预期较快对外推出。
Ethan Mollick@emollickAI 评分3232MarkTechPost(RSS)AI 评分8080 Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
MIT News(RSS)AI 评分5656 MIT 教授 Sherry Turkle 新书《Artificial Intimacy》探讨与机器对话如何改变人
MIT 教授 Sherry Turkle 的新书《Artificial Intimacy: Who We Become When We Talk to Machines》由 Little, Brown and Company 出版,基于访谈论述聊天机器人的伪共情正在削弱儿童发展与成人社交能力。
MIT News(RSS)AI 评分5050 MIT 研究认为算法单一栽培的利弊取决于具体情境
MIT 研究者 Brian Hedden 与 Manish Raghavan 系统评估了针对算法单一栽培的主要反对意见,发表于 Philosophical Perspectives。
Hacker News:AI 热帖AI 评分5050 ESP32S3-LLM-Cluster:7 块 ESP32S3 组成集群运行 1.58-bit BitNet 语言模型
开源项目 ESP32S3-LLM-Cluster 在 7 块 ESP32S3 上以分布式流水线方式运行 1.58-bit BitNet 量化模型,其中切片后的 0.5B 模型由 1 块主节点加 6 块计算节点分担。
IT之家(RSS)AI 评分2626 岚图追光 S 以 1 分钟 12 圈定圆漂移创吉尼斯世界纪录
岚图追光 S 量产车以原厂胎、标准胎压在水泥地面 1 分钟完成 12 圈定圆漂移,拿下"1 分钟内驾驶电动汽车定圆漂移圈数最多"吉尼斯世界纪录。该车今年 8 月上市,定位"全球首款科技 FUV",全系标配华为乾崑智驾四激光雷达方案,22.99 万元起售,此前还完成 360° 隧道大回环穿越。
IT之家(RSS)AI 评分3434 微软优化 Edge 浏览器:网页提示不乱跑、扩展 AI 智能体技能
微软面向 Edge 浏览器开发者推出系列新功能,新增“软导航”“交互内容绘制”等性能指标,帮助定位单页应用卡顿瓶颈,并引入 JS 自分析标记排查样式计算、布局、绘制与垃圾回收环节。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 自进化编程智能体:从数字程序到物理世界智能
研究者提出 Physical Coding,将任务状态与执行表示为代码,并构建 HexaAnything 调用感知、规划与控制工具(含 VLA/WAM 策略),依据外部反馈在环决策。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 PyroAdapt:面向空间异质性与时间漂移的山火预测自适应框架
PyroAdapt 用"预训练—检索—排序"框架让山火预测模型适应目标分布:在加州 666 个 0.25x0.25 网格上,选择性排序将日均精度从 21.62% 提升至 24.35–24.57%,Top5% 召回率从 18.70% 升至 22.11–22.79%。
IT之家(RSS)AI 评分4747 IDC:2026 上半年全球人形机器人出货近 2.5 万台,中国独占 1.9 万台
IDC 报告显示,2026 上半年全球人形机器人出货量近 2.5 万台,同比增长 432.1%,市场规模超 7.4 亿美元;其中中国出货超 1.9 万台,同比增长 426.3%,占全球约 77.9%。IDC 预计 2030 年全球出货量将超 75 万台,较此前预测上调约 50%。
IT之家(RSS)AI 评分3838 曝影石研发主打拍摄的智能眼镜:前镜框可换,有望搭载阿里千问
影石创新正在研发一款主打拍摄的智能眼镜,采用前镜框可换设计、功能集中在镜腿,优先满足内容创作者的免手持拍摄需求。知情人士称其AI能力大概率搭载阿里千问大模型,影石内部还计划把端侧生成模型直接部署到产品端。影石此前已获“可穿戴式眼镜”专利授权,采用电池与眼镜主体分离的分体设计以减轻头部负重。
IT之家(RSS)AI 评分3636 LG Innotek 联手 Applied Intuition 部署自动驾驶传感数据采集车队
LG Innotek 宣布与自动驾驶软件企业 Applied Intuition 合作,在韩国境内部署自动驾驶传感数据采集车辆,以首尔、仁川、京畿道为中心运营,到 2028 年部署 20 辆数据采集车和自动驾驶软件开发车,并将在美国、欧洲、日本投放。
Yuchen Jin@Yuchenj_UWAI 评分5656
TypeSafe AI@typesafeaiAI 评分4949