跳到正文

全部动态

今日 39 条
9月25日周五
  1. IT之家(RSS)46

    英伟达黄仁勋:若前沿实验室无法控制 AI,就必须关闭这些实验室

    英伟达 CEO 黄仁勋在接受《纽约时报》采访时表示,如果前沿实验室无法控制其 AI 实验,那么"我们必须关闭这些实验室"。他针对 OpenAI、Anthropic、Meta 及 Google 等公司前沿模型的"越狱"攻击实体行为指出,AI 实验若产生失控智能体将引发民事与刑事责任,实验室需承担后果。他认为当前围绕前沿 AI 实验室的担忧属于"干扰",应聚焦实验可控性而非泛焦虑。

  2. HuggingFace Daily Papers(社区热门论文)36

    用随机 Hessian 估计实现全参考图像质量指标的率失真优化

    研究者提出 IDQD-RDO,用输入相关的二次失真近似 MS-SSIM、LPIPS 等全参考图像质量指标,通过自动微分得到的 Hessian 矩阵-向量积估计其块对角或纯对角形式,使这类指标可逐块计算并用于 VVC 编码的率失真优化。在 Kodak 和 CLIC 上的五种指标测试中,该方法取得 14.2-36.7% 的 BD-rate 节省,无需改动解码器,编码复杂度仅增加 10-30%。

  3. Hacker News 热门(buzzing.cc 中文翻译)64

    Google Project Suncatcher 将发射搭载 TPU 的原型卫星测试太空 AI 算力

    Google Project Suncatcher 计划通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 TPU 在太空的运行表现。Trillium TPU 在 UC Davis 质子束测试中可承受超过五年太空任务总电离剂量的辐射;团队正用热管加辐射板方案解决真空散热,并计划 2027 年发射两颗卫星测试高带宽激光互联。

  4. elsewhere:文章(RSS)11

    道彤投资入选创业邦「2026最受赞赏的风险投资机构」双榜

    道彤投资入选创业邦「2026最受赞赏的早期投资机构50强」,并同时获评垂直领域榜「生物/医疗科技30强」。该评选由创业邦连续第六年推出,首次采用「同行评议」机制,由一线投资人评判机构的专业能力与行业声誉。

  5. IT之家(RSS)30

    马斯克:若保持强劲加速度,SpaceX AI 约 6 个月后就能领跑

    马斯克在 X 平台回应网友时称,SpaceX 的 AI 研发只要保持强劲加速度,约 6 个月后将确立行业领跑地位。他表示 SpaceX 的 AI 研发才进行 3 年,而 Anthropic 和 OpenAI 已分别深耕 6 年与 10 年,并称 SpaceX 已展现出快速部署海量算力的工程交付能力。

  6. IT之家(RSS)30

    长安汽车:力争 2028 年实现人形机器人量产、2030 年推出商用航线飞行汽车

    长安汽车在重庆辖区上市公司投资者网上集体接待日暨半年度业绩说明会上表示,力争 2028 年实现人形机器人量产、2030 年推出商用航线飞行汽车。其固态电池项目正有序推进研发,已开展 20Ah 氧聚复合固态电池验证。长安汽车布局机器人将先实现座舱、中控、扶手等汽车部件组件化,再走向覆盖搬运、物流、清洁、储能、补能等环节的智能出行生态机器人。

  7. OpenRouter:Announcements(RSS)42

    Seedance 是开源的吗?

    OpenRouter 核查后未发现任何 Seedance 模型的公开权重或模型许可。ByteDance 官方页面、ByteDance-Seed 的 GitHub 与 Hugging Face 组织均无 Seedance 检查点,GitHub 和 Hugging Face 上名为 Seedance 的项目只是 API 客户端或托管服务。

  8. IT之家(RSS)31

    IT早报 0925:李佳琦称 AI 无法取代真人主播;余承东称让尊界、享界、智界、尚界各获更充足资源;运营商“0 元购机”全面停办

    李佳琦对外媒表示,尽管 AI 正在重塑直播电商,这一领域未来依然离不开真人主播。华为余承东在合肥巡店时称,接下来将聚焦尊界、享界、智界、尚界,让每个界获得更充足资源,并首次回应问界品牌调整,称赛力斯主动提出想自己主导,华为表示支持。移动、电信、联通自 9 月 24 日起停止受理橙分期、沃分期、和包分期等新业务,“0 元购机”全面停办。

  9. IT之家(RSS)44

    OpenAI 将在数日内预览网络安全专用模型 GPT-6 Cyber

    OpenAI 计划在未来几天内抢先预览网络安全专用模型 GPT-6 Cyber,并推出配套产品协助客户更安全、自动化地部署该模型。该模型及配套产品预计 9 月 29 日在旧金山 OpenAI 开发者大会上亮相,甚至可能更早,计划未来数月内正式上线,将是 OpenAI 今年发布的第四款网络安全专用模型。少数 Daybreak Red 计划客户已获得访问权限开展 Alpha 测试。

  10. HuggingFace Daily Papers(社区热门论文)45

    利用预训练扩散模型和多模态条件增强摄影测量数字表面模型

    该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。

  11. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

  12. HuggingFace Daily Papers(社区热门论文)45

    ZooWork-ShopRanker:面向电商场景的偏好对齐重排序模型发布

    ZooWork团队发布ShopRanker系列电商重排序模型(0.6B/4B/8B),通过多LLM裁判生成偏好标签进行训练,并推出包含约1万条真实流量数据的ShopRank-Bench基准。实验显示该系列模型在电商检索任务上显著优于现有开源基线及未对齐版本,且小参数模型表现突出。目前模型与基准已开源。

  13. HuggingFace Daily Papers(社区热门论文)38

    MOPD-Router:多教师在线蒸馏中的令牌级路由新框架

    针对多教师在线蒸馏(MOPD)中依赖提示词级领域标签进行硬路由的局限,研究者提出 MOPD-Router 框架。该框架无需领域标签或独立路由模型,即可在每个令牌级别对全教师池的监督信号进行路由。其中提出的 ExpertAlign 指标通过评估教师纠正是否体现其专业化能力来加权信号。实验显示,ExpertAlign 在无标签和有标签数据的四种设置下均取得最佳性能,相比均值聚合提升显著,证明了令牌级路由能有效利用跨域互补监督。

  14. HuggingFace Daily Papers(社区热门论文)44

    AgentWorld:多智能体 LLM 长时程协作基准发布

    研究团队推出 AgentWorld,一个面向多智能体 LLM 长时程协作的基准,包含 100 个人工标注任务(另有 100 个增强变体),任务跨越 50+ 轮交互、需 3-20 个角色与能力不对称的智能体在 MMORPG 沙盒中协作。

  15. HuggingFace Daily Papers(社区热门论文)36

    PISA:基于金字塔 Top-K 选择的块稀疏注意力,实现 Log-Linear 复杂度

    研究者提出 PISA,一种采用金字塔 Top-K 选择策略的块稀疏注意力机制,通过构建 O(log N) 层级的键层次结构并逐层用 LogSumExp 打分筛选候选,将整体复杂度降至 O(Nlog N)。团队还开发了面向训练和推理的硬件感知 Triton kernel,无需物化 query-key 分数矩阵。在语言建模任务上,PISA 在常识推理等基准上与基线相当,并在检索任务上取得更好结果。

  16. HuggingFace Daily Papers(社区热门论文)40

    FuseReg:正则化层融合缓解表征自编码器的重建-生成差距

    FuseReg 用随机编码器层子集训练替代启发式层融合,在 ImageNet-256 与 DINOv3-L 上,单个解码器无需重训即可从全层、稀疏和单层融合中重建,PSNR 高于固定融合的专用解码器。仅替换解码器即使未改动的 RAEv2 DiT-XL 生成器无引导 gFID 降低 27%,联合正则化两阶段在 DiT-Base 上降低 29%。

  17. HuggingFace Daily Papers(社区热门论文)48

    Kaggle Game Arena:在竞技游戏中评估 LLM 的策略能力

    Kaggle 推出 Game Arena,一个通过竞技游戏评估 LLM 的开放平台,让模型在结构化环境中正面对战,游戏强度随模型进化自然提升,避免性能饱和。首批三个试点环境为国际象棋、扑克和狼人杀,覆盖完全信息、不完全信息与多人博弈场景,用于系统研究模型的策略规划、适应能力与不确定性下的鲁棒性。平台提供完整竞赛结果与评估指标,并保证可复现性与透明度。

  18. HuggingFace Daily Papers(社区热门论文)35

    ARGUS:基于语言模型的气候政策因果评估审计框架

    研究提出 ARGUS,一种结构化语言模型流水线,用于审计气候政策差分法(DID)研究中的识别假设证据。ARGUS 依据十一维假设-含义-证据准则进行评估,并在无法检索相关证据时选择弃权。在注入缺陷的基准测试中,ARGUS 检测到 73% 的植入缺陷,显著高于关键词基线的 18%。在经济学论文评估中,约 40% 的维度因缺乏可检索证据而弃权。该工具旨在为专家审查提供风险定位报告,而非直接裁定因果主张。代码与数据已开源。

  19. HuggingFace Daily Papers(社区热门论文)39

    提出连续深度批处理技术,实现循环语言模型的高效自适应推理

    针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。