跳到正文

全部动态

今日 39 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)40

    RenderRank:用压缩视觉 token 学习文本重排序

    RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。

  2. HuggingFace Daily Papers(社区热门论文)38

    MT-OPSD:面向多轮图像编辑的在线策略自蒸馏框架

    针对现有图像编辑模型在递归编辑中快速退化的问题,研究者提出 MT-OPSD 在线策略自蒸馏框架,让模型在自生成的条件下状态上训练,并由干净条件教师模型提供编辑监督,无需多轮标注。该工作同时发布 LME-Bench,包含 100 组十轮编辑会话,用于评估长程鲁棒性。在三个编辑骨干上的实验显示,MT-OPSD 显著提升长程编辑成功率、减少多轮崩溃,并基本保持单轮编辑质量。

  3. HuggingFace Daily Papers(社区热门论文)33

    GeoVerse:在几何隐空间中实现世界一致的新视角合成

    GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。

  4. HuggingFace Daily Papers(社区热门论文)43

    InfiniHand:从第一视角视频流式估计世界坐标系手部运动

    InfiniHand 是一个端到端流式前馈框架,可直接从未标定的第一视角视频中联合估计 MANO 参数、相机轨迹和手部位置,无需级联独立的手部姿态估计器与 SLAM 系统。在域内基准上,其 ARCTIC PA-p 相比 ViDiHand 降低 21.4%,并显著缓解世界坐标系漂移,运行速度达 11.19 FPS,吞吐量超过 HaWoR 两倍。

  5. HuggingFace Daily Papers(社区热门论文)45

    模型内部表征何时有用?表征工程在 LLM 安全中的角色评估

    一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。

  6. HuggingFace Daily Papers(社区热门论文)49

    距离去掉视觉编码器还有多远?无编码器多模态预训练的缩放定律

    研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

  7. IT之家(RSS)31

    中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题

    中国科学院 9 月 29 日在北京发布“科学前沿极限突破计划”及首批 10 个项目,聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,并试点与极限突破性研究相适应的评价方式,减少预设目标和过程干预,不唯论文产出和短期成果。

  8. OpenAI:官网动态(RSS · 排除企业/客户案例)55

    OpenAI 提出前沿 AI 训练安全案例框架的初步准则

    OpenAI 发布安全文档框架提案,主张前沿强化学习训练在开跑前应准备结构化的安全案例。文中给出三类初步准则,包括对齐训练与遏制监控等技术保障、异议与审批等运营流程,以及错位事故的调查与公开披露做法,并表示这些实践正在 OpenAI 内部实施且欢迎社区反馈。

  9. Hacker News 热门(buzzing.cc 中文翻译)32

    叶序:一款音频响应式LED显示屏

    开发者用 Processing 生成黄金角螺旋点阵并做 Voronoi 剖分,再用 CadQuery 建模、3D 打印出 89 颗可寻址 RGB LED 的叶序造型灯盘。灯盘由 STM32 blackpill 驱动,通过 SPI 控制 neopixel,并接入 INMP441 I2S 数字麦克风,借助 ARM CMSIS 库做傅里叶变换与多频段能量分析,实现随房间声音变化的音频响应效果。

  10. IT之家(RSS)41

    SEMIFIVE 接获美国 AI 芯片企业订单,开发支持 LPDDR6 的数据中心推理 ASIC

    韩国芯片设计服务企业 SEMIFIVE 将为一家美国无晶圆厂 AI 芯片企业开发支持 LPDDR6、PCIe Gen5 的数据中心级推理加速器,这是 LPDDR6 成为 ASIC 片外缓存选择的早期案例之一。该芯片预计 2027H1 流片、2028 年量产出货,订单采用“规格交接”模式,总价约 703 亿韩元,为 SEMIFIVE 史上最大单笔合同,也是其北美首个同类型项目。

  11. IT之家(RSS)27

    2026 年世界互联网大会乌镇峰会 11 月 2 日至 5 日举行:设 27 个分论坛,聚焦人工智能开源开放

    2026 年世界互联网大会乌镇峰会将于 11 月 2 日至 5 日在浙江乌镇举行,主题为“开源开放共建共享 —— 携手构建网络空间命运共同体”。本届峰会设置 27 个分论坛,主论坛设“人工智能乌镇对话”环节,邀请全球领军科技企业、知名开源大模型企业负责人及人工智能科学家围绕全球人工智能开源生态构建展开交流。“互联网之光”博览会已邀请 400 余家企业参展。

  12. 公众号:千问APP(阿里)40

    千问与夸克网盘打通:6TB 文献、废片和素材被玩成知识地图与作品集

    千问与夸克网盘深度打通,用户可让千问读取网盘资料并重新整理。有博士把 6TB 文献梳理成个人知识库和可视化知识地图,有用户从几千张照片中筛出精华生成全球旅行地图和明信片 PDF,还有人用三步学习法在 48 小时内啃完一门新学科。整理好的资料可一键上传夸克网盘并生成分享链接,用于团队协作。

  13. IT之家(RSS)32

    科技部:我国成为创新力上升最快的国家之一,2025 年研发投入超 3.92 万亿元

    科技部部长阴和俊在国新办“开局起步‘十五五’”发布会上介绍,2025 年全社会研发投入超过 3.92 万亿元,占 GDP 比重达 2.8%,首次超过 OECD 成员国平均水平。PCT 国际专利申请量和高水平国际期刊论文数量连续多年保持世界第一,开源大模型领跑全球。《国家创新指数报告 2025》显示我国国家创新能力综合排名位居全球第 9 位。

  14. IT之家(RSS)65

    OpenAI 明日重开 200 美元 ChatGPT Pro 订阅,API 等效价值翻倍

    OpenAI 首席产品官 Tibo 宣布明天向新用户重新开放月费 200 美元的 ChatGPT Pro 订阅,并调整用量计算方式,等效 API 价值相比旧方案约减半支出。新方案不恢复 5 小时使用限制,仅保留周额度管理;此前因 GPT-6 Astra 算力需求激增,OpenAI 曾于 9 月 11 日暂停新用户注册。OpenAI 还预告明天将为 Pro 订阅新增更多不计量功能,具体内容暂未公布。

  15. IT之家(RSS)44

    中国气象局发布《气象数据管理办法》,11 月 1 日起实施

    中国气象局 9 月 29 日发布《气象数据管理办法》,将于 11 月 1 日起正式实施。该办法建立公共气象数据授权运营机制,为公共气象数据确权、授权运营提供明确法规依据,填补制度空白。同时鼓励各类主体开展气象数据开发利用技术、高质量数据集研究建设,并明确数据出境与安全评估等安全保障制度。

  16. IT之家(RSS)71

    央视起底 AI 语音网贷诈骗:浙江乐清两月上千人被骗、涉案流水超千万元

    浙江乐清警方破获一起利用 AI 语音系统实施网贷诈骗的案件,两个月内致上千人受骗,30 名嫌疑人被抓,涉案流水超千万元,冻结资金 100 余万元。团伙用 AI 机器人批量外呼引流,单日呼出可超 20 万次,按 A 至 F 六级筛选意向用户后转人工话务员行骗,并利用正规平台会员退费规则的知识盲区骗取信任。

  17. IT之家(RSS)49

    麦肯锡:到 2035 年约 1100 万美国劳动者或因 AI 转行

    麦肯锡 9 月 29 日报告称,到 2035 年约 1100 万美国劳动者或因 AI 替代岗位而需转行,占现有劳动力约 7%,年度转行人数或从 21.5 万增至三倍。最可能转行的是办公室和行政支持、零售和销售、运输和物流岗位,低收入者需转行的可能性接近高收入者的 8 倍,报告估计最终人数在 600 万至 1600 万之间。

  18. Greg Brockman50

    OpenAI 发布关于保障前沿 RL 训练运行安全的安全案例文章,Greg Brockman 转发并称这些最佳实践反映了其当前在 securing frontier RL training 方面的经验。文中提出安全案例应覆盖技术栈三方面:对齐训练、遏制与监控,确保模型不采取失控行为、即使发生也难以突破遏制且监控能在危害前发现。对齐层面包括自动与人工数据集审查、调整 grader 惩罚模型利用 RL 环境漏洞的行为、对既往实验轨迹运行分类器验证 grader,以及通过评估追踪模型错位倾向来衡量对齐训练效果。文章链接:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

  19. Thomas Wolf55

    @classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。