#数据/训练
#数据/训练
今日 2 条
Rohan Paul@rohanpaul_aiAI 评分7272HuggingFace Daily Papers(社区热门论文)AI 评分6363 ZGCM-1:完全开源的 7B 数学与智能体搜索基础模型
ZGCM-1 是一个完全开源的 7B 稠密基础模型,从零训练,主打在 256K 上下文中结合内部思考与外部工具调用,在数学推理和智能体搜索任务上可媲美 Qwen3-235B-A22B、GLM-5.1 等更大的前沿模型。
Together AI 研究与产品博客(RSS)精选AI 评分6363 Together AI 扩展微调服务:新增模型、实验跟踪与更细训练控制
Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。
推荐理由:原文给出新模型支持、Expert LoRA 实测对比、自动早停和降价幅度等具体细节,读者可据此评估微调工作流的实际改进。
Google Research:Blog(网页)AI 评分4848 Google Research 提出 ToolGrad:用文本“梯度”高效生成工具调用数据集
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反推用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Rohan Paul@rohanpaul_aiAI 评分6666
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6363 OpenAI 在 ChatGPT Work 中推出 Data agent
OpenAI 在 ChatGPT Work 中推出新的 Data agent,用户用自然语言即可连接公司数据、分析变化并生成可分享的交互式仪表盘。
推荐理由:官方公布了数据源和 BI 工具接入范围及权限管控方式,读者可据此评估它在自有数据工作流中的落地路径。
The Verge:AI(RSS)AI 评分6868 数学家 Andreas Thom 要求 OpenAI 证明未将其工作用于训练
继 NYU 教授 Tristan Buckmaster 公开质疑后,数学家 Andreas Thom 在 Mastodon 指控 OpenAI 不透明且不诚实,担心他与同事和 ChatGPT 的互动可能进入了训练数据,并促成 OpenAI 上月宣布的 10 项结果之一,该非 sofia 群结果大量依赖 Thom 和 Gábor Kun 的先前工作。
elvis@omarsar0AI 评分5151Hacker News:AI 热帖AI 评分5454 Hugo Vergnes 花费 $998 训练 3.8B 模型 little-lm,CORE 得分 0.384
作者 Hugo Vergnes 用租用的 8× B200 在 43 小时内以 $998 训练了 3.8B 参数模型 little-lm,在 65.3B tokens 上达到 CORE 0.384,超过 GPT-2 1.5B 的 0.2565。
Epoch AI@EpochAIResearchAI 评分5151Hacker News:AI 热帖AI 评分5858 Qwen3.8 在 GPT-5.5 Pro 推理 prefill 实验中表现出与 GPT 系模型的显著重合
作者 wsxiaoys 将开源模型的推理 prefill 实验更新到 v1.1,改用 GPT-5.5 Pro 作为教师模型,在 45 个问题(STEM、非 STEM、合成谜题各 15 个)上测量目标模型被注入教师推理前 1% 后可见答案的重合度。
Cognition 模型 / Devin 博客(网页)精选AI 评分7070 Cognition 发布 SWE-2 编码模型,以更低成本逼近前沿
Cognition 发布最先进编码模型 SWE-2,基于 2.8T 参数的 Kimi K33 后训练,在 FrontierCode 1.1 Main 取得 50.0%,仅比 Fable 5.1 低不到一分且便宜 64%。
推荐理由:官方详细公开了 SWE-2 的训练方法与成本惩罚公式,读者可以借此理解如何用 RL 推移整条成本性能前沿。
Fireworks AI(网页)AI 评分5454 Genspark 与 Fireworks Lab 将 MiniMax M3 后训练为 Gen-1 Slides,以约 1/17 成本比肩 Opus 5
Genspark 与 Fireworks Lab 合作,通过 RL 后训练将开源多模态模型 MiniMax M3 打造成 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Hugging Face:Blog(RSS)AI 评分5656 IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可
IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。
DAIR.AI@dair_aiAI 评分5959TechCrunch:AI(RSS)AI 评分6161 Ramp 数据显示 8 月头部企业人均 AI 支出下滑近 10%
Ramp 汇总 70,000 家公司的支出数据发现,8 月支付 AI 产品的客户占 56%,环比仅增长 0.4%,样本中头部 1% 企业的人均 AI 支出下降近 10% 至 $7,205。
Anthropic:The Institute(旗舰研究长文 · 网页)精选AI 评分6464 Anthropic 发布经济情景模型,推演 AI 对 2030 年美国就业与工资的影响
Anthropic 经济团队基于技术报告《Economic Scenarios for Transformative AI》发布交互式经济情景探索工具,把经济表示为任务束,推演 AI 到 2030 年对美国经济的影响。
推荐理由:原文给出模型化的三种经济情景和关键数字,读者可以据此理解AI对不同职业工资和就业的可能影响。
X.PIN@thexpinAI 评分8282
Rohan Paul@rohanpaul_aiAI 评分5454Jensen Huang 在接受 Axios 采访时回应“开源模型公司是否应被允许蒸馏闭源模型”,称从 AI 和他人知识中学习是智能的基础,更聪明的 AI 也可以是更安全的 AI。
IT之家(RSS)AI 评分5353 京东云宣布与摩尔线程规划建设 10 万卡 AI 工厂
在 2026 京东全球科技探索者大会上,京东云总裁曹鹏公布 AI 基建进展,京东云已与摩尔线程等打造国产万卡集群,并规划建设 10 万卡集群。数据方面京东云正推进 1,000 万小时数据采集,模型方面已形成覆盖多模态、世界模型和具身模型的 JoyAI 基础模型矩阵。摩尔线程张建中表示该 AI 工厂可用于训练大模型、生产词元和智能体,并希望服务各行业打造具身智能。
LG AI Research:官方研究博客AI 评分5353 LG AI Research 发布表格基础模型 EXAONE Tabular,纯合成数据预训练
LG AI Research 发布面向结构化表格数据的分类与回归基础模型 EXAONE Tabular,完全基于 SCM 合成数据预训练,未使用任何真实表格数据,通过上下文学习免重训直接预测。
Epoch AI:研究、数据与评测AI 评分5656 Epoch AI 推出 AI Chip Users explorer,估算五大前沿实验室算力使用量
Epoch AI 推出 AI Chip Users explorer,以 Nvidia H100 等效值(H100e)估算 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 和 SpaceXAI 用于研究、训练和推理的算力。
HuggingFace Daily Papers(社区热门论文)AI 评分7474 NVIDIA 发布 Nemotron IMO 2026 开源配方,纯自然语言证明拿下 30/42 达金牌线
NVIDIA 基于 Nemotron 3 Ultra 训练 SFT 与 RL 两个专精检查点,结合生成-验证-精炼的测试时推理流水线,在 IMO 2026 正式得分 30/42,超过 29 分的金牌线,全程不使用形式化证明器、外部工具或联网。
Rohan Paul@rohanpaul_aiAI 评分5151
Aidan Gomez@aidangomezAI 评分5454The Decoder:AI News(RSS)AI 评分7373 数学家 Buckmaster 称 OpenAI 施压并要求将 Anthropic 职位合作者移出 Navier-Stokes 论文
数学家 Tristan Buckmaster 公开发声,称 OpenAI 在其与 Levent Alpöge 借助 Claude 和 Codex 运行 GPT-5.6 Sol 在 Navier-Stokes 方程上取得进展后对其施压。
Dwarkesh Patel:Podcast & Blog(RSS)精选AI 评分6060 Dwarkesh Patel 研究:预训练进步主要来自数据改进
Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。
推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。
AGIBOT 智元(网页)AI 评分5252 智元发布GE-Act 2.0,首次验证原生世界—动作模型预训练与Scaling路径
智元发布原生世界—动作模型GE-Act 2.0,所有参数从随机初始化在具身操作数据上从头训练,不针对评测任务微调或示范。
OpenBMB@OpenBMBAI 评分5858公众号:面壁智能(MiniCPM)AI 评分5858 面壁智能联合 OpenBMB 开源 MiniCPM5-2B,AA 榜单 4B 以下综合第一
9 月 8 日,面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,支持工具调用、深度搜索、代码生成。
MarkTechPost(RSS)AI 评分5656 Reducto 发布 r-1 单遍文档解析模型,错误率降 20%、每页 1 美分
Reducto 发布 r-1,用一次全页解析替代多阶段 agentic OCR 流水线,官方称相较自家旧管线错误率降低 20%,价格从每页 3 至 6 美分降至 1 美分全包。r-1 原生处理表格、阅读顺序、格式和边界框 grounding,需 V3 Parse API 通过 settings.model 开启,暂无开源权重;对标 Amazon Textract 等的评测为厂商自测,未公开数据集。
Simon Willison 博客AI 评分6161 kernel.org 运维者谈滥用爬虫:14 个 CPU 核心专为爬虫渲染 git 提交页面
Simon Willison 转述 Konstantin Ryabitsev 的观察:git.kernel.org 为应付滥用爬虫的“背景辐射”,在 5 个地理分布节点上常年有 14 个 CPU 核心专门把 git 提交渲染成 HTML,CPU 开销超过包括 git clone 在内的所有合法访问。Willison 担忧这对提供大量可爬网页的 Datasette 也有影响。
MarkTechPost(RSS)AI 评分5353 Axis Robotics 联合多校发布 AXIS 浏览器端数据引擎:207 个操作任务、50,129 条轨迹
Axis Robotics 与 UC Berkeley、Georgia Tech、NTU 等机构提出 AXIS,把机器人操作演示采集搬进浏览器,通过 MuJoCo WebAssembly 前端遥操作 Franka Research 3,发布含 207 个任务、50,129 条轨迹、超 6 万种任务或场景变体的数据集,由 7 万多名社区成员贡献。
The Decoder:AI News(RSS)AI 评分6464 AI 设计的药物 rentosertib 在早期试验中显示可降低预测生物学年龄
Insilico Medicine 用生成式 AI 开发的肺纤维化候选药 rentosertib,在 42 人试验数据的新分析中显示可降低预测生物学年龄,结果发表于 Nature Biotechnology。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6666 vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
X.PIN@thexpinAI 评分6363IT之家(RSS)AI 评分5959 科大讯飞发布星火 X2.5 模型:293B-A30B MoE 架构,全国产平台训练
科大讯飞 9 月 7 日正式发布星火 Spark X2.5 多语言文本生成模型,基于全国产平台训练,采用 MoE 框架,参数为 293B-A30B,支持 256K 上下文。模型全面提升代码和智能体能力,覆盖 200 余种语言,已在讯飞星辰 MaaS 平台上线,输入定价 1.6 元/百万 Token(缓存命中 0.24 元),输出 6 元/百万 Token。
Charlie O’Neill 研究写作(RSS)AI 评分6060 Charlie O'Neill 谈 RL 环境信仰与理性下注:长、真、自有
Charlie O'Neill 撰文指出,宣称一切将是 RL 环境的人很少按该信念做出理性行动,如同当年 scaling 和 AGI 信奉者并不真下注。他提出无论 RSI 是否成立都应造高价值数据与环境:若 RSI 成立,单位效用环境价值将指数增长,值得在实验室内做最有针对性、可累积的环境;若不成立,实验室需要模型在所有领域变强,会为有用数据支付高价。
IT之家(RSS)AI 评分6666 Anthropic 15 亿美元 AI 版权和解金开始发放,出版社与作者分配争议不断
Anthropic 15 亿美元(约合 101.02 亿元人民币)版权和解金进入发放阶段,法院认定训练模型属合理使用,但盗版获取的近 50 万部作品每部赔偿原作者 3,000 美元。
Rohan Paul@rohanpaul_aiAI 评分6565Microsoft 论文提出把昂贵测试时推理摊销为蒸馏技能:收集 35–50 条历史轨迹,由编码智能体提取重复失败模式并编译成 markdown 技能加入非推理模型 system prompt。