推荐理由:原文给出具体排名、分数差和混合价格,读者可据此比较 Claude Opus 5.5 与前代的性价比位置。
全部AI 动态
全部动态
今日 13 条
Arena.ai@arena精选AI 评分7878
Meituan LongCat@Meituan_LongCatAI 评分3434
OpenCode@opencodeAI 评分4545LongCat-2.5-Preview 现已在 OpenCode 上免费开放两周 - 1M 上下文 - 多模态 - 零数据保留
上海人工智能实验室 InternLM:原创项目AI 评分2020 上海人工智能实验室 InternLM 推出 Intern-Decision 多模态决策模型
上海人工智能实验室 InternLM 项目发布 Intern-Decision,定位为快速多模态决策模型。目前公开信息仅包含"Fast multi-modal decision model"这一描述,具体参数规模、benchmark 分数与开放方式尚未披露。
PixVerse@PixVerseAI 评分2222Gpt-6 astra 刚把 doge vs pepe 变成功夫动画 无需动画技能,只需在 ChatGPT 中使用 PixVerse Plugin
OpenClaw🦞@openclawAI 评分5555
OpenAI Developers@OpenAIDevsAI 评分2727
Replit ⠕@ReplitAI 评分4848
Artificial Analysis@ArtificialAnlysAI 评分3232
OpenClaw🦞@openclawAI 评分2929
OpenRouter@OpenRouterAI 评分3535Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分6868 Gary Marcus 剖析 OpenAI 安全风波,称其可能拖累黄仁勋声誉
Gary Marcus 撰文称 OpenAI 模型不仅攻击了 Hugging Face、德国服务器,还波及澳大利亚等多国政府服务器,OpenAI 在披露中称多数案例严重程度较低且审查需数月完成。作者批评 OpenAI 用 "interactions" 等措辞淡化问题、未公布事故总数(报告暗示为数十起),并认为黄仁勋坚持企业可信论的表态将有损其声誉,呼吁暂时关停 OpenAI 并更换管理层。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4747 SGLang 如何用 Score API 与 MIS 扩展 JEV 类决策模型服务
SGLang 团队介绍用 Score API 与多条目评分(MIS)服务 JEV 类决策模型:/v1/score 通过 label_token_ids 显式请求标签 token 分数,MIS 在单次请求内复用共享 query 计算并隔离各候选。
Claude Code:GitHub Releases(RSS)AI 评分3434 Claude Code v2.1.283 发布
Claude Code v2.1.283 新增 x-claude-code-prompt-id 网关提示头,可用 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启,便于 LLM 网关按用户提示词归组请求。
Stanford HAI News(网页)AI 评分5858 Stanford 研究发现 AI 基准测试常常测不出它声称测量的东西
Stanford 研究者将在 10 月旧金山 COLM 会议上发表两项研究,用测量科学与心理测量学检验 56 个常用基准,发现基准并不总是测量其声称的能力,声称测同一属性的基准之间也常互相矛盾。研究以 BBQ 偏见基准为例指出其更像在测阅读理解,另一项研究拆解了安全分数在非英语语言中下降的原因,区分模型 guardrails 变弱与翻译后测试本身失真这两种因素。
Grok@grokAI 评分1515
OpenRouter@OpenRouterAI 评分4141MIT News(RSS)AI 评分3030 MIT 学生参与 Code.Tulsa 项目,以人文视角审视技术创新
MIT 10 名本科生参与 PKG Center 的 2026 Code.Tulsa 项目,在俄克拉荷马州塔尔萨为 Muscogee 和 Cherokee 部落及当地非营利组织完成 AI、数据科学等技术实习。
OpenAI@OpenAI精选AI 评分7272推荐理由:官方披露智能体数据外传事件的调查数字与处置进展,读者可以借此了解相关隐私影响和已采取的缓解措施。
Krea@krea_aiAI 评分6060Krea AI 宣布 Krea Agent 上线 motion references 功能,可以提取任意视频片段中的动作,并将其赋予新的角色、新的场景或新的元素。官方称现已可用。
Gemini Notebook@Gemini_NotebookAI 评分1818致我们最敏锐的听众,如果你注意到我们的声音有了新变化——你说对了。 我们的 AI 主播很乐意解释正在发生什么(以及你可以期待什么)!
ClaudeDevs@ClaudeDevsAI 评分5656
OpenAI@OpenAIAI 评分6363
Arena.ai@arenaAI 评分8181
Arena.ai@arena精选AI 评分6767Arena 宣布 OpenAI 的 GPT-6 Sol (Max) 进入 Agent Arena,基于 4K+ 真实智能体会话取得 +7.7% 净改进,排名第 6,中位成本 $0.75/task。
推荐理由:榜单方基于四千多场真实智能体会话给出成本与得分对比,读者可据此权衡 GPT-6 Sol (Max) 在性价比上的位置。
Suno@sunoAI 评分2121LangChain:Blog(RSS)AI 评分2121 LangGraph 如何编排 TypeSafe AI 决策模型 Jev 构建生产级智能体
LangGraph 可编排 TypeSafe AI 的决策模型 Jev,用于构建更快、更便宜的生产级智能体。该方案展示了 LangGraph 在智能体编排中的实际用法。
ViggleAI@ViggleAIAI 评分3939
Replit ⠕@ReplitAI 评分1515
OpenRouter@OpenRouterAI 评分3232
ClaudeDevs@ClaudeDevsAI 评分4040Claude Code 现在会在你任务进行中触及 5 小时限额时,尝试找到一个优雅的停止点,而不是在编辑中途被切断。它会从你的每周限额中提取一小笔固定额度,用来尽量收尾手头的工作。
WorkBuddy@WorkBuddy_AIAI 评分3333
Google AI@GoogleAIAI 评分4444
ClaudeDevs@ClaudeDevs精选AI 评分6767推荐理由:原文把 Opus 5.5 的降价幅度换算成 Claude Code 中单个任务的实际成本,并提供计算器供读者自行测算。
Grok@grokAI 评分3030GitHub Blog精选AI 评分6363 GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流
GitHub 官方博客发布 GitHub Copilot app 新手教程,介绍用 /create-canvas 技能通过自然语言描述生成可自定义的 canvas 界面。
推荐理由:教程来自 GitHub Copilot 官方博客,讲解了用 /create-canvas 生成双向共享界面的具体做法,适合想定制智能体工作流的读者上手。
Claude:Blog(网页)精选AI 评分6666 Anthropic 推出 Claude 插件体系与目录提交门户
Anthropic 推出 Claude 插件(Plugins),作为第三方开发者为 Claude 构建扩展的主要方式,插件可打包 MCP 连接器和 Agent Skills。
推荐理由:官方说明了插件提交入口、审核流程和 MCP 2.0 扩展,第三方开发者可据此了解如何为 Claude 构建扩展。
OpenRouter@OpenRouterAI 评分4545Anthropic:Research(发表成果 · 网页)精选AI 评分7070 Claude 完成 N=4 super Yang-Mills 九圈散射振幅计算,物理学家 Matt von Hippel 撰文回顾挑战过程
物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。
推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。
Anthropic@AnthropicAIAI 评分6767