跳到正文

全部动态

今日 1 条
9月20日周日
  1. 公众号:火山引擎50

    石化盈科×火山引擎:TRAE 嵌入研发全流程,数千人组织向 AI Native 转型

    石化盈科与火山引擎合作全面引入 TRAE IDE,目前已开通 2000+ 座席、月消耗 1000 亿+ Tokens,深度嵌入需求分析、代码编写到测试交付的研发全流程。双方通过两期 AI 精英训练营覆盖 120 名员工,并由火山引擎 FDE 教练驻场陪跑,4 个月跑通基于 AI 原生的工业软件 iMOM 研发,项目研发周期较传统模式缩短 50%、综合研发成本降低 30%。

  2. 公众号:生数科技(Vidu·视频)21

    生数科技入选2026北京民营企业科技创新百强与未来产业先锋榜

    生数科技入选“2026北京民营企业100强”系列榜单中的“科技创新百强”和首次发布的“未来产业先锋榜”,成为唯一同时入选两项榜单的通用世界模型企业。其Vidu Q3 是全球首个支持 16 秒声画同出的视频生成模型,Vidu S2 含 S2-Avatar 与 S2-Editing 两个模型,Motus2 则将策略、世界模拟与价值评估纳入统一的视频—动作模型。

  3. 公众号:阶跃星辰(Step)66

    阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重

    阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。

    推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。

  4. 公众号:MiniMax(稀宇科技)36

    MiniMax 公布全球六大合作案例:M3 落地 Genspark、HUMAIN 与 Nebius

    MiniMax 披露六项全球合作:Genspark 基于 MiniMax M3 开放权重后训练出 PPT 专用模型 Gen-1 Slides,并成为其 AI Slides 标准模式默认模型,200 个真实生产任务评测中综合与视觉设计得分均列五个参测模型第一,单份生成成本为 Claude Opus 5 的十分之一。

  5. LangChain:Blog(RSS)25

    Jev 能否成为更好的智能体评测器?

    LangChain 测试了 Jev 与 LLM 评委在准确率、可重复性、延迟和成本四个维度的表现,以验证 System One 模型能否为智能体评测提供新思路。

9月19日周六
  1. Gary Marcus:The Road to AI We Can Trust(RSS)35

    Gary Marcus 批评 Dario Amodei 一周内三次透支可信度

    Gary Marcus 发文列举 Dario Amodei 一周内三次损害自身可信度的做法:为 Anthropic 挑选的独立监督方是与其关系密切的 METR 和已有业务往来的 Accenture,同时 Anthropic 正筹建缺乏机构审查委员会监督的湿生物学实验室。Marcus 认为 Amodei 呼吁"放慢前沿"的表态与实际行动不符,并称 Google 同样难以信任。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)36

    OpenAI 发布澳大利亚青少年安全蓝图

    OpenAI 发布澳大利亚青少年安全蓝图,为保护青少年使用 AI 提出六支柱路线图,涵盖 AI 素养、适龄防护、隐私保护型年龄验证、现实危机支持对接和家长控制。今年 8 月,OpenAI 已开始在澳大利亚为 13 至 17 岁用户推出 ChatGPT for Teens 默认体验,并配合家长控制与未满 18 岁安全政策。

  3. Claude Code:GitHub Releases(RSS)34

    Claude Code v2.1.278 发布

    Claude Code v2.1.278 将 Claude API、Enterprise 用户及 Bedrock、Vertex、Foundry 和网关上的 auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。

  4. Databricks:Blog(RSS)46

    Databricks RADAR:用异常检测捕捉灰色故障

    Databricks 推出 RADAR,一套四阶段、指标无关的灰色故障检测方案,由可靠性指标、异常检测、告警和根因分析组成,在其内部实现超过 90% 的精确率和快 95% 的故障发现速度。该系统采用无监督流式模型 SPOT,从过去 14 天数据学习正常基线,只需一个风险参数而无需手工设定阈值,可基于 Databricks 原生组件为计费、转化或模型性能等任意指标搭建。

  5. OpenRouter:Announcements(RSS)63

    OpenRouter 实测 Jev 决策模型对比 LLM,何时该用决策模型替代生成文本

    OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。

    推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。

  6. Epoch AI:研究、数据与评测54

    Epoch AI 分析:数学预印本中致谢 AI 使用的比例从4月的4%升至8月的25%

    Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。

  7. Epoch AI:研究、数据与评测30

    Epoch AI 披露数学研究 AI 使用统计的局限性:分类由 GPT-5.6 Sol 完成

    Epoch AI 指出其数学研究 AI 使用统计存在多重局限:AI 致谢与用例分类由 GPT-5.6 Sol 完成,可能含错误,且仅凭披露难以精确判断 AI 贡献程度。数据仅覆盖 arXiv 预印本正文中自愿披露的 AI 致谢,趋势可能反映披露行为变化而非 AI 使用变化,源文件注释中的提示词等信号被排除。作者识别对常见姓名、早期研究者及无 arXiv ID 或 ORCID 者可能不准或不全。

  8. Epoch AI:研究、数据与评测45

    Epoch AI 如何用 GPT-5.6 Sol 与 Claude Fable 5 统计数学论文中的 AI 使用

    Epoch AI 发布"AI Use in Math Research"探索器的方法说明,用 GPT-5.6 Sol 读取 2023 年至今的 arXiv 数学论文全文,识别 AI 使用致谢并分类研究、写作、代码计算、文献综述与形式化等用例,Claude Fable 5 独立复核研究类与形式化标签。

  9. Epoch AI:研究、数据与评测29

    Epoch AI 发布 AI 在数学研究中的使用数据集

    Epoch AI 发布「AI Use in Math Research」数据集,以 gzipped CSV 形式提供按子领域划分的 arXiv 数学论文月度趋势数据,更新于 2026 年 9 月 18 日。数据可在其官网以可视化形式查看或下载,采用 Creative Commons Attribution 许可,可免费使用、分发和复制,需注明来源与作者。