石化盈科×火山引擎:TRAE 嵌入研发全流程,数千人组织向 AI Native 转型
石化盈科与火山引擎合作全面引入 TRAE IDE,目前已开通 2000+ 座席、月消耗 1000 亿+ Tokens,深度嵌入需求分析、代码编写到测试交付的研发全流程。双方通过两期 AI 精英训练营覆盖 120 名员工,并由火山引擎 FDE 教练驻场陪跑,4 个月跑通基于 AI 原生的工业软件 iMOM 研发,项目研发周期较传统模式缩短 50%、综合研发成本降低 30%。
石化盈科与火山引擎合作全面引入 TRAE IDE,目前已开通 2000+ 座席、月消耗 1000 亿+ Tokens,深度嵌入需求分析、代码编写到测试交付的研发全流程。双方通过两期 AI 精英训练营覆盖 120 名员工,并由火山引擎 FDE 教练驻场陪跑,4 个月跑通基于 AI 原生的工业软件 iMOM 研发,项目研发周期较传统模式缩短 50%、综合研发成本降低 30%。
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
SkyProduction(天工工作台)联合火山引擎推出中秋国庆特惠,Seedance 2.5 720P 有参考视频场景单价低至 0.27 元/秒,个人至尊版(加量)年付 11,999 元。
生数科技入选“2026北京民营企业100强”系列榜单中的“科技创新百强”和首次发布的“未来产业先锋榜”,成为唯一同时入选两项榜单的通用世界模型企业。其Vidu Q3 是全球首个支持 16 秒声画同出的视频生成模型,Vidu S2 含 S2-Avatar 与 S2-Editing 两个模型,Motus2 则将策略、世界模拟与价值评估纳入统一的视频—动作模型。
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。
非常感谢 @kiaran_ritchie 展示我们全新的 Smart UV 功能!✨ 如果你还没在 P2.0 里试过,那你就错过了。↓
MiniMax 披露六项全球合作:Genspark 基于 MiniMax M3 开放权重后训练出 PPT 专用模型 Gen-1 Slides,并成为其 AI Slides 标准模式默认模型,200 个真实生产任务评测中综合与视觉设计得分均列五个参测模型第一,单份生成成本为 Claude Opus 5 的十分之一。
LangChain 测试了 Jev 与 LLM 评委在准确率、可重复性、延迟和成本四个维度的表现,以验证 System One 模型能否为智能体评测提供新思路。
全力出击 ALL-IN ⚡ @AstonMartinF1 和 @MagnusCarlsen 与 Cohere 一同出席了加拿大最大的 AI 会议
Nathan Lambert 撰文阐述他仍不支持真正的递归自我改进(RSI),坚持自己的“有损自我改进”基线判断。
Gary Marcus 发文列举 Dario Amodei 一周内三次损害自身可信度的做法:为 Anthropic 挑选的独立监督方是与其关系密切的 METR 和已有业务往来的 Accenture,同时 Anthropic 正筹建缺乏机构审查委员会监督的湿生物学实验室。Marcus 认为 Amodei 呼吁"放慢前沿"的表态与实际行动不符,并称 Google 同样难以信任。
失传的猫功夫,用 GPT-6 Astra + Blender 重现。 由 PixVerse 创作者 @woleswoosh 制作 完整提示词见下方。
一个火柴人进去。一只有着企业工作的水豚出来。 在 Blender 里放几个灰色形状和圆锥体,PixVerse 上的 GPT-6 Astra 就把它们变成了一只身处火把照亮地牢中、穿着西装的水豚
OpenAI 发布澳大利亚青少年安全蓝图,为保护青少年使用 AI 提出六支柱路线图,涵盖 AI 素养、适龄防护、隐私保护型年龄验证、现实危机支持对接和家长控制。今年 8 月,OpenAI 已开始在澳大利亚为 13 至 17 岁用户推出 ChatGPT for Teens 默认体验,并配合家长控制与未满 18 岁安全政策。
Claude Code v2.1.278 将 Claude API、Enterprise 用户及 Bedrock、Vertex、Foundry 和网关上的 auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。
Databricks 推出 RADAR,一套四阶段、指标无关的灰色故障检测方案,由可靠性指标、异常检测、告警和根因分析组成,在其内部实现超过 90% 的精确率和快 95% 的故障发现速度。该系统采用无监督流式模型 SPOT,从过去 14 天数据学习正常基线,只需一个风险参数而无需手工设定阈值,可基于 Databricks 原生组件为计费、转化或模型性能等任意指标搭建。
OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。
推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。
Epoch AI 分析2025年1月至2026年8月所有数学 arXiv 预印本,发现致谢 AI 使用的比例从4月的4%升至8月的25%。方法是用 AI 关键词筛选后由 GPT-5.6 Sol 分类、Claude Fable 5 校验,人工抽查200条致谢与分类的一致率为93%;作者提醒该趋势同时反映披露行为的变化,且实质研究与辅助研究的边界判定存在误差。
本周 Replit 动态 1)自定义连接器:让 Agent 连接集成库之外的 API 2)扩展审计日志:为 Enterprise 管理员新增 65+ 事件 🧵
Epoch AI 指出其数学研究 AI 使用统计存在多重局限:AI 致谢与用例分类由 GPT-5.6 Sol 完成,可能含错误,且仅凭披露难以精确判断 AI 贡献程度。数据仅覆盖 arXiv 预印本正文中自愿披露的 AI 致谢,趋势可能反映披露行为变化而非 AI 使用变化,源文件注释中的提示词等信号被排除。作者识别对常见姓名、早期研究者及无 arXiv ID 或 ORCID 者可能不准或不全。
Epoch AI 发布"AI Use in Math Research"探索器的方法说明,用 GPT-5.6 Sol 读取 2023 年至今的 arXiv 数学论文全文,识别 AI 使用致谢并分类研究、写作、代码计算、文献综述与形式化等用例,Claude Fable 5 独立复核研究类与形式化标签。
Epoch AI 发布 AI Use in Math Research 探索工具,提供 2023 年 1 月至 2026 年 8 月 arXiv 数学预印本中 AI 致谢率及致谢类型的月度估算。该工具为初始版本,原文同时列出了局限性说明。
Epoch AI 发布「AI Use in Math Research」数据集,以 gzipped CSV 形式提供按子领域划分的 arXiv 数学论文月度趋势数据,更新于 2026 年 9 月 18 日。数据可在其官网以可视化形式查看或下载,采用 Creative Commons Attribution 许可,可免费使用、分发和复制,需注明来源与作者。