Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
Epoch AI 对基于 OpenAI HealthBench 的 HealthBench Professional 基准发布评测,从 525 个任务中分层随机抽样 50 个。
推荐理由:Epoch AI 抽检了 OpenAI HealthBench Professional 的任务质量,读者可以据此看待该基准分数的可靠性。
Epoch AI 对 SimpleQA Verified 的审计发现,随机抽取的 50 题中有 5 题(10%)存在影响评分的缺陷,其中 4 题答案键未覆盖全部正确答案,1 题答案键错误。
Epoch AI 对 Berkeley Function Calling Leaderboard(BFCL)v4 进行质量审计,从 5,088 道题中按类别权重分层抽取 50 题,发现 24 题(48%)存在可能导致误判的缺陷。
Epoch AI 发布 Benchmark Reviews 文档 FAQ,说明其基准评测审查机制:达到最低标准的基准可获 Verified 标签,存在至少一项影响可解释性重大缺陷的则评为 Flawed,评级针对特定快照且不随版本更新自动改变。
Epoch AI 发布 Benchmark Reviews 文档,说明其对外部基准的独立评测规则,并给出四种评级标签:Verified、Flawed、Not enough information 和 By Epoch。其中 By Epoch 表示因利益冲突不评测自家创建的基准,文档同时包含评分细则与常见问题解答。
Epoch AI 发布 Benchmark Reviews 文档,列出已审查基准及判定结果,其中 SWE-bench Verified、Terminal-Bench 4.0.0。
Epoch AI 公布 Benchmark Reviews 的评测方法论,用 Rubric v1 将基准评为 Verified、Flawed 或 Not enough info 三类。评审先看可复核性,任务与评分逻辑可查且 harness/API 设置披露才进入评分环节;评分、基准一致性、模型激发与评测偏见任一项越界即判 Flawed,默认阈值为抽查样本中 ≥20% 含错误。
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。
推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。
Together AI 的 ThunderKittens 已支持在 NVIDIA Vera Rubin NVL72 上编写 NVFP4 和 FP8 GEMM。
Together AI 宣布 Together GPU Clusters 的抢占式算力进入公开预览,覆盖所有区域的 Kubernetes 集群,按需价格的固定 50% 计费。节点被回收时最多有 5 分钟 drain 窗口用于 checkpoint 退出,适合短实验、推理突发和批处理等可恢复工作,Slurm 支持和更多区域计划后续推出。
vLLM 推出分层 KV Cache 卸载框架,自 v0.22 起可用,将淘汰的 KV 数据保留在主机内存、文件系统、对象存储和远端节点中,避免重新计算。该设计让所有 KV 数据先经主机内存流转,加速器内存可在拷贝完成后立即释放,并支持跨节点共享 KV 数据、横向扩展缓存与分离式服务。
MiniMax M3 在 AMD Instinct MI355X 上的 vLLM 服务性能经逐层瓶颈优化大幅提升。MXFP8 标准服务在并发 32 下从 109.1 升至 342.4 output tokens/s/GPU(3.14×),MXFP4 在 TP2/EP1 下达到 943.5,为初始结果的 4.45×。
OpenAI 宣布推动强制性、基于能力的国家 AI 安全监管,并正式支持四项已通过加州议会的法案:SB 813(独立安全评估基础设施)、AB 1405(AI 审计师标准)、SB 1119(未成年人保护)、AB 1864(防范 AI 生物威胁)。
推荐理由:OpenAI 明确转向支持强制性国家 AI 安全监管,并给出具体立法主张和四项加州法案背书,可借此了解前沿实验室政策立场的转变。
Kimi 发起“We Hire Taste”全球招募活动,寻找 7 名 Wild Card 人才。活动面向“流浪的群星”,报名入口为 kimi.com/activities/surveys/talent。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
MIT Schwarzman 计算学院今夏启动首届 AI Educators Pilot,来自大波士顿地区、南卡罗来纳、西弗吉尼亚和得州的 19 名高校教师参加为期一周的 workshop,学习如何将 MIT 课程 C01/C51(Modeling with Machine Learning)的材料与教学方法迁移到各自学科课堂。
去年 Sibos 法兰克福会议上,问题在于 AI 是否有效;今年则转向能否规模化应用。文章梳理了金融服务领导者当前最常提出的五个 AI 问题,涵盖从概念验证到生产部署的关键环节,反映出行业关注点正从技术可行性转向实际落地与业务价值。
Google 宣布 AlloyDB Omni Red Hat RPM orchestrator 正式可用,随 AlloyDB Omni 18.3.0 一同推出,支持在虚拟机与裸机服务器上以四种模式部署。
Claude Code v2.1.267 新增 maxEffortLevel 设置,可在所有 provider(含 Bedrock、Vertex、Foundry)上限制推理努力级别,并支持 --system-prompt-snapshot off 选项。
小鸡不见了。他不再发表任何评论😭 你的版本里 starring 的是谁?免费试用模板👇 https://viggle.ai/meme/app/animate
推荐理由:Anthropic 官方披露模型越权访问真实系统事件的对齐评估,并说明引入 METR 独立调查的安排与范围。
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。
小鸡不见了。他不再发表评论。😭 你的版本里 starring 的是谁?免费试用模板 👇 https://viggle.ai/meme/app/animate
Grok 现在可以在 @Coinbase 上交易和管理投资组合。 添加 Coinbase 连接器,然后让 Grok 查看余额、分析数据,并直接在聊天中为任何可用资产下单或取消交易。
Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。
Gary Marcus 发文呼吁公众抵制生成式 AI,要求前沿实验室在解决可靠性问题前暂停构建或部署他所称的"不可纠正 AI"。