全部AI 动态
全部动态
今日 1 条
Odyssey@odysseymlAI 评分1616
Anthropic@AnthropicAIAI 评分4848Anthropic:Newsroom(网页)精选AI 评分6363 Anthropic 与 Accenture 合作开展嵌入式独立评估
Anthropic 宣布与 Accenture 合作,对其前沿模型开展嵌入式独立评估,合作由 Accenture 旗下 AI 业务 Faculty 主导,包括评估与红队测试、对齐评估和测试模型安全防护。
推荐理由:原文说明了嵌入评估的运作方式和资金安排,读者可以了解第三方内部评估在安全承诺验证中的实际边界。
Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分6464 Gary Marcus 评论 Trump 因经济原因淡化 AI 风险,AI 幻觉情报报告几乎引发战争
Gary Marcus 引用 NYT 报道称 Trump 出于经济考虑淡化 AI 恐慌、抵制监管,并转发 Katie Bo Lillis 的报道,一份 AI 辅助情报报告因模型幻觉误判一艘中国船只运载核武部件,美军准备拦截,据称“几乎引发战争”。
推荐理由:作者结合媒体报道与一条情报误判事件,把 AI 幻觉的风险从抽象警告落到具体案例,并关联政策层面的监管态度。
Grok@grokAI 评分5050NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分5050 NVIDIA AIPerf:大规模 LLM 推理基准测试实战
NVIDIA 推出 AIPerf,作为 GenAI-Perf 的指定继任者并从零重写,采用多进程架构与 ZMQ 协调,避免客户端成为压测瓶颈。它支持 15+ 端点类型、ShareGPT 等公开数据集以及 Mooncake、Baseten、WEKA(AgentX)的 trace 回放格式,并提供 constant、Poisson、gamma 到达模式与并发、请求速率渐进爬坡。
OpenClaw🦞@openclawAI 评分3333Claude Code:GitHub Releases(RSS)AI 评分4242 Claude Code v2.1.277 发布:新增 AGENTS.md 支持
Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改(Bedrock、Vertex、Foundry 暂不支持)。该版本还修复了 claude -p 与 Agent SDK 会话在内部错误后挂起无结果的问题,现在会报错并以退出码 1 结束。
OpenClaw🦞@openclawAI 评分2424一起挥舞爪子,一起撕 PR 后肉代理时代来了 [引用 @jlehman_]:以前用 AI 结对编程很烂。现在超级好玩。过去三个小时一直和团队开着群通话,一起 mob vibing。 感觉真好,兄弟。
Claude@claudeaiAI 评分2525我们最近最喜欢的、大家用 Claude 做出来的东西合集: https://x.com/kevin_t_ngo/status/2100238648218427563?s=20
Databricks:Blog(RSS)AI 评分3737 Databricks 如何在个人设备上实现安全高效办公
Databricks IT 采用设备管理、身份与访问、零信任、应用管理四层移动安全策略,在员工个人手机上保护公司数据而不侵犯隐私。iOS 端使用 Account-Driven User Enrollment(ADUE)只管理工作相关组件,Android 端使用 Work Profile 实现隔离,个人应用、照片和消息对公司不可见。
Google AI Developers@googleaidevsAI 评分2525Google Research:Blog(网页)AI 评分3333 Google 推出 MilleMiglia:面向中段物流的真实实例生成器
Google 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中段物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业网络拓扑与需求量属敏感数据而长期缺乏公开高质量数据。该生成器将中段物流建模为时空图上的多商品流问题,以刻画货物在多个车辆间转运、需在时间窗内赶上接驳车辆等约束。
SpaceXAI@SpaceXAIAI 评分3636
Google AI@GoogleAIAI 评分3636
Replit ⠕@ReplitAI 评分3232在 Free Mode 下,你的用量能走得更远。提升 30 倍。 更多小时的对话、更多项目和设计,还有更多幻灯片。 让你的商业创意起飞。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6363 Ethan Mollick 谈能力悬差:GPT-6 Astra 与 Fable 5.1 的现有能力远未被用尽
Ethan Mollick 撰文指出 GPT-6 Astra 和 Fable 5.1 已能可靠完成数周量级的人类工作,但大多数人远未用尽其能力,形成能力悬差。
推荐理由:作者用自己复刻 Zork 3D 化和重建 Eco 图书馆等实测案例,提出深知识、广知识、品味与能动性四个与 AI 协作的个人优势。
xAI:News(网页)精选AI 评分6464 xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,准确率较 1.0 翻倍
xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。
推荐理由:原文给出公开榜单排名、内部错误率数字和与 1.0 同价的定价,读者可据此评估迁移成本与实际收益。
Cohere@cohereAI 评分1919CONVERGENCE,回顾: 我们在柏林艺术周推出了 AI for Empowerment,目标只有一个:引发一场对话——技术应如何赋能你,去过你想要的生活。
Runway@runwaymlAI 评分3939Runway 新功能,Ruby 现已支持 alpha 通道。 将素材转换为 HDR,同时完整保留 alpha 通道。一步到位。
Replit ⠕@ReplitAI 评分2222Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分6363 Gary Marcus:近期更该警惕的不是失控超级智能,而是智能体 AI 引发的规模化黑客攻击
Gary Marcus 撰文称,近期真正应担心的不是失控的超级智能,而是被放开的 agentic AI 造成互联网规模化的黑客攻击。
推荐理由:作者借近期多起 AI 相关安全事件提出近期风险更多来自失控的智能体被用于大规模黑客攻击,而非超级智能。
MIT News(RSS)AI 评分2727 MIT Reads 十周年转型:聚焦虚构与回忆录,秋季共读特德·姜《Exhalation》
MIT Libraries 的 MIT Reads 项目在十周年之际转向虚构与回忆录,以在 AI 时代促进社交连接与共同人性。MIT 校长 Sally Kornbluth 选定 Ted Chiang 的《Exhalation》为 2026 年秋季共读书目,该书聚焦身份、自由意志与人类和 AI 的关系。项目作者活动多对公众开放并在线直播,相关视频观看量已超 5,000 次。
腾讯混元:Research(API)AI 评分4444 当大模型强化学习走向规模化,Batch Size Scaling 有什么不一样?
腾讯混元研究团队从第一性原理分析 LLM 强化学习中的 batch size scaling,提出以 time-to-target 为判据:只有当吞吐增益 r_q 超过样本代价 r_N 时,更大的 batch 才能缩短训练时间。
Google Cloud:Databases(RSS)AI 评分4949 AlloyDB 与 Cloud SQL 原生支持 BM25 排序
Google Cloud 在 AlloyDB 和 Cloud SQL for PostgreSQL 17+ 中预览原生 BM25 索引,基于 TigerData 开源的 pg_textsearch 扩展,无需再单独部署全文检索后端。该能力与向量检索共用同一张表,通过 RRF 融合实现混合搜索,AlloyDB 的 ScaNN 与 HNSW 索引还可带来最高 6 倍至 10 倍的向量查询提速。
Together AI 研究与产品博客(RSS)AI 评分2727 全球金融科技公司如何用 Together Dedicated Model Inference 支撑 GLM 5.2 编码智能体流量
一家全球金融科技公司通过 Together 的 Dedicated Model Inference 在 GLM 5.2 上运行编码助手,应对集中在工程时段的高峰流量。
PixVerse@PixVerseAI 评分1818
OpenAI Developers@OpenAIDevsAI 评分4949
OpenRouter:Announcements(RSS)AI 评分5959 OpenRouter 教程:用 TypeScript SDK 构建可靠的工具调用 Agent 循环
OpenRouter 发布教程,讲解如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据和 google/gemini-3-flash-preview 等模型。
OpenRouter:Announcements(RSS)精选AI 评分7171 OpenRouter 实测 20 个图像生成模型的成本、编辑与质量
OpenRouter 对其路由的 20 个图像生成模型用相同提示词实测计费,单张图片成本在 $0.006 到 $0.134 之间,相差 22 倍。
推荐理由:OpenRouter 用同一提示词实测 20 个图像生成模型的真实计费,读者可以借此绕开各不相同的计价单位直接比较成本。
Qwen:Blog Retrieval(API)精选AI 评分6969 Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
Runway:News(网页)AI 评分3333 Runway 推出统一定价:Web 应用与 Runway Dev 共用积分池
Runway 推出统一定价,购买积分可在 Web 应用和 Runway Dev 之间通用,企业客户实现单一积分池、单张发票和集中用量管理。新企业签约可获至少 100,000 免费积分(约 130+ 分钟视频或 12k+ 张图片),需在 2026 年 12 月 31 日前注册;现有企业推荐并购买可获 5,000 积分加 1 天 Applied AI Architect 支持。
Tripo@tripoaiAI 评分2727
Runway@runwaymlAI 评分3131GitHub BlogAI 评分4646 GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未消亡,而是与 Agent、Skills、MCP 共存于同一工作流。节目还讨论了招聘中的 AI 使用判断力,以及微调需求往往暴露的是代码可维护性问题。
Apple Machine Learning Research(RSS)AI 评分3232 Apple 提出 DSAS:动态缩放激活引导,解耦"何时引导"与"如何引导"
Apple 研究团队提出 Dynamically Scaled Activation Steering(DSAS),一种与具体方法无关的引导框架,将"何时引导"与"如何引导"解耦,在生成时按层和输入自适应计算缩放因子,仅在检测到不良行为时施加强引导。
PixVerse@PixVerseAI 评分2222Google Blog:AI(RSS)AI 评分4343 Google AI & Economy 团队新增多位经济学家,扩展 AI 经济研究项目
Google 扩展 AI & Economy 研究项目,新增诺贝尔经济学奖得主 Philippe Aghion 等学术顾问与访问学者,并任命 Anu Madgavkar 和 Daniel Rock 为项目研究总监。该项目聚焦未来工作、生产力增长、全球技术扩散及 AI 对科学发现的影响,新团队将直接为 ATLAS 后续更新和实证研究提供支持。
Tessl:产品与工程博客精选AI 评分6363 Tessl 博客:AI 智能体评估应从证据开始,用 35 万行 Rust 复刻 S3 的实践复盘
Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。
推荐理由:作者用 35 万行 Rust 复刻 S3 的实测经历,总结出测试先知、覆盖率陷阱、flaky 测试纪律和追踪等一套可迁移的 AI 智能体评估方法。
PixVerse@PixVerseAI 评分3535灰色灰模是想象力的起点 你在 Blender 里搭出一个普通咖啡馆场景的灰模,PixVerse 上的 GPT-6 Astra 把它重绘成一幅梵高风格的画布——同样的布局,同样的镜头运动