跳到正文

#数据/训练

今日 0 条
10月5日周一
  1. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入 agentic AI 时代

    企业 AI 的竞争前沿已从预测转向自主决策,核心问题变成如何让预测系统在不偏离业务意图的前提下自行采取行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新;其依赖的数据也从规整的数值记录扩展到非结构化来源。Everest Group 合伙人 Vishal Gupta 称,企业已不再满足于回望式视角,而「analytics」一词正让位于 AI。

10月3日周六
  1. MIT Technology Review · AI12

    MIT Technology Review:自主 AI 如何重新定义企业智能

    MIT Technology Review 报告指出,企业 AI 正从工具转向「智能体式转变」的运营模式,全球 AI 投资 2026 年将达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的扩展瓶颈是结构性的,流程优先的公司正在领先,数据就绪而非数据规模才是 AI 产生复利效应的关键。报告建议重建数据基础设施、采用可组合架构,并解决 AI 主权问题。

10月2日周五
9月29日周二
  1. Greg Brockman50

    OpenAI 发布关于保障前沿 RL 训练运行安全的安全案例文章,Greg Brockman 转发并称这些最佳实践反映了其当前在 securing frontier RL training 方面的经验。文中提出安全案例应覆盖技术栈三方面:对齐训练、遏制与监控,确保模型不采取失控行为、即使发生也难以突破遏制且监控能在危害前发现。对齐层面包括自动与人工数据集审查、调整 grader 惩罚模型利用 RL 环境漏洞的行为、对既往实验轨迹运行分类器验证 grader,以及通过评估追踪模型错位倾向来衡量对齐训练效果。文章链接:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

9月26日周六
9月24日周四
9月23日周三
9月22日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)52

    提出 Spymark 概念:隐藏在媒体中的追踪信号不是水印

    作者 Brandon Thomas 提出 Spymark 一词,指嵌入媒体、可在用户不知情下追踪来源的隐性信号,以区别于传统可见水印。他以 Google SynthID 为例,其 SynthID-O 可在 512x512 图像中编码 136-bit 载荷,足以容纳 64-bit 数据库标识符加纠错位;音频、文本同样可被嵌入追踪信号,且部分可抗压缩与编辑。

9月20日周日
9月18日周五
  1. Anthropic:The Institute(旗舰研究长文 · 网页)73

    Anthropic 发布前沿 AI 开发节奏测量工具与内部指标快照

    Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。

    推荐理由:Anthropic 公开测量自身 AI 研发自动化程度、智能体监督和算力分配的方法与数据,读者可以看到前沿实验室透明度报告的一种可复用范式。

  2. Ars Technica:AI(RSS)65

    微软高管曾称 AI 抓取是"人类历史上最大规模的劳动窃取",新闻集团据此推进诉讼主张

    新闻集团在诉讼动议中指责 Microsoft 将为 Bing 购买的数据集转售给 OpenAI 作训练数据,且 OpenAI 从受商业限制协议约束的第三方获取含 180 万篇文章的 NYT 数据集并用于训练。原告方引用微软内部文件承认生成式 AI 对训练数据生产者就业存在"真实风险",并主张法院若认定抓取新闻不属于合理使用,可打破各 AI 公司竞相免费搭车的"囚徒困境"。

9月16日周三
  1. IT之家(RSS)55

    集邦咨询预计 2026 年全球数据中心用电需求同比增长 31% 至 161GW

    TrendForce 集邦咨询发布 AI Server 产业研究,预估 2026 年全球数据中心电力需求容量达 161GW,同比增长约 31%,其中 AI Server 占 33.4%。报告预计 2027 年增速仍超 30%,2030 年需求达 490.7GW,而电网可供容量仅 222.6GW,账面缺口 268GW,其中包含表后自建发电未被计入及并网交付延期两部分因素。

9月15日周二
  1. IT之家(RSS)77

    404 Media 曝光 OpenAI 莉莉计划:人工审核 ChatGPT 聊天记录以优化模型

    404 Media 披露 OpenAI 内部代号为莉莉计划(Project Lily)的项目,由时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。

    推荐理由:报道披露了人工审核流程的运作细节和隐私边界,读者可以据此了解模型优化背后的人力环节与数据风险。

9月12日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)67

    Beren Millidge、John Schulman、Charlie O'Neill 对谈递归自我改进离我们还有多远

    Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。

    推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。

9月11日周五
9月10日周四
9月9日周三
  1. Anthropic:The Institute(旗舰研究长文 · 网页)64

    Anthropic 发布经济情景模型,推演 AI 对 2030 年美国就业与工资的影响

    Anthropic 经济团队基于技术报告《Economic Scenarios for Transformative AI》发布交互式经济情景探索工具,把经济表示为任务束,推演 AI 到 2030 年对美国经济的影响。

    推荐理由:原文给出模型化的三种经济情景和关键数字,读者可以据此理解AI对不同职业工资和就业的可能影响。

9月8日周二
  1. Simon Willison 博客61

    kernel.org 运维者谈滥用爬虫:14 个 CPU 核心专为爬虫渲染 git 提交页面

    Simon Willison 转述 Konstantin Ryabitsev 的观察:git.kernel.org 为应付滥用爬虫的“背景辐射”,在 5 个地理分布节点上常年有 14 个 CPU 核心专门把 git 提交渲染成 HTML,CPU 开销超过包括 git clone 在内的所有合法访问。Willison 担忧这对提供大量可爬网页的 Datasette 也有影响。

9月7日周一
  1. Charlie O’Neill 研究写作(RSS)60

    Charlie O'Neill 谈 RL 环境信仰与理性下注:长、真、自有

    Charlie O'Neill 撰文指出,宣称一切将是 RL 环境的人很少按该信念做出理性行动,如同当年 scaling 和 AGI 信奉者并不真下注。他提出无论 RSI 是否成立都应造高价值数据与环境:若 RSI 成立,单位效用环境价值将指数增长,值得在实验室内做最有针对性、可累积的环境;若不成立,实验室需要模型在所有领域变强,会为有用数据支付高价。

9月5日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)45

    为什么下一个令牌预测器是对 LLM 的错误思维模型

    作者认为下一个令牌预测器只是对 LLM 的零阶近似,机制形态正确但不完整。现代后训练中的 RLVR 让模型通过自己探索生成的新序列并获得奖励来学习,类似会穷尽探索的象棋引擎而非模仿大师棋谱的下一步预测器,因此 RLHF 和 RLVR 编码的内容早已超出对现有文本的预测。

9月4日周五