全部AI 动态
全部动态
今日 14 条
Cohere@cohereAI 评分3838
Artificial Analysis@ArtificialAnlysAI 评分4646Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分6262 Gary Marcus 评 Dario Amodei 的放慢 AI 发展提议:三份赞誉加两分怀疑
Gary Marcus 评析 Dario Amodei 倡导放慢 AI 发展并支持透明度的文章,Sam Altman 与 Elon Musk 迅速表示认同。Marcus 肯定其透明度承诺,但列举多方质疑:METR 与 AI 公司关系过近、Anthropic 借对华威胁维持加速、以及该提议可能意在抢先于真正的监管。
Artificial Analysis 完整文章(网页)AI 评分3737 Artificial Analysis 发布 Capability Indices v1.1,强化领域调优
Artificial Analysis 将 Capability Indices 升级至 v1.1,结合 Intelligence Index v4.2 和 v4.3 的评估切片与专项评测,按领域进行更强调优。
LlamaIndex:产品、工程与评测AI 评分3636 智能文档处理平台:多数厂商做错了什么
多数智能文档处理(IDP)平台在演示与生产环境之间存在10到20个百分点的准确率差距,干净 PDF 上98%的提取准确率在实际收件上可能只有82%。文章指出核心失效点是文档多样性,模板依赖会随时间累积维护成本,而图表、示意图、图像等非文本内容常被传统 IDP 忽略。现代方案改用 LLM 编排层,按元素类型将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型。
Cohere@cohereAI 评分2121🇩🇪 CONVERGENCE 🇩🇪 AI for Empowerment 在柏林艺术周首映,配乐来自 Actress 与 Sega Bodega
Tripo@tripoaiAI 评分1515我们开播了! 现在就加入 Tripothon S1 线上启动会。👇 https://x.com/i/broadcasts/1dGYlagqvylKX
Robbyant@robbyant_brainAI 评分2424
Artificial Analysis@ArtificialAnlysAI 评分6262
Tripo@tripoaiAI 评分5050vLLM 官方博客(RSS)AI 评分5353 vLLM 优化 Kimi K3 服务性能:吞吐提升 2.2–2.8 倍
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
OpenAI Developers@OpenAIDevsAI 评分7070Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分5757 Gary Marcus 质疑 Dario Amodei 智能体群六个月内接管互联网的说法
Gary Marcus 撰文分析 Dario Amodei 新随笔中关于流窜智能体群可能在六个月内接管互联网的说法,认为其既模糊又不太可信。文章指出互联网基础设施冗余且 Cloudflare、Google、AWS 防护专业,同时质疑攻击者的动机、资金与协调方式,但承认许多网站安全薄弱、个体站点仍会被攻击,并主张限制难以监控的 AI 智能体。
Claude Code:GitHub Releases(RSS)AI 评分3030 Claude Code v2.1.270 修复只读 git 命令误请求权限问题
Claude Code 发布 v2.1.270,修复了会话运行一段时间后 Bash 中只读 git 命令意外请求权限的问题,该问题为 2.1.269 引入的回归。
Cohere@cohereAI 评分1313
PixVerse@PixVerseAI 评分2727
PixVerse@PixVerseAI 评分2222世界上最长的对打,始于 GPT-6 Astra 用 3D 映射了一段简单的乒乓球对打。PixVerse 把它送遍了地球与太空。 记录任何日常动作。PixVerse 把它变成你能想象的任何场景。
PixVerse@PixVerseAI 评分3434
OpenAI Developers@OpenAIDevsAI 评分8080OpenAI 开发者账号宣布发布 GPT-6 Astra,并汇总社区开发者基于它做出的构建案例,包括 2234 个建模解剖部件的 3D 展示、Unreal Engine 曼哈顿复刻。
Arena.ai@arenaAI 评分6565Suno:Blog(网页)精选AI 评分6868 Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。
推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。
Fireworks AI(网页)AI 评分5151 Fireworks 评测 2026 年九款最佳开源 LLM,GLM 5.2 与 Kimi K3 领跑基准
Fireworks 发布 2026 年开源 LLM 选型指南,覆盖 GLM 5.2、Kimi K3、Kimi K2.7 Code、DeepSeek-V4-Pro/Flash、MiniMax M3、Qwen3.7 Plus、gpt-oss-120b 和 Gemma 4 31B IT 九款模型。
Grok@grokAI 评分3333
Tripo@tripoaiAI 评分2323
Tripo@tripoaiAI 评分4949
OpenCode@opencodeAI 评分2929
Huawei Cloud@HuaweiCloud1AI 评分2222
MeshyAI@MeshyAIAI 评分2525公众号:生数科技(Vidu·视频)AI 评分5555 生数科技发布 Motus2:面向灵巧操作的自进化通用世界模型
生数科技发布面向机器人灵巧操作的世界模型 Motus2,将行动、预测、评估三种能力统一进同一个共享参数模型,形成生成动作、预测未来、评估结果、更新策略的闭环,并加入轻量触觉专家模块。
Qwen@Alibaba_QwenAI 评分4444
OpenCode@opencodeAI 评分3535公众号:百度智能云(文心)AI 评分5656 百度智能云秒哒3.8全面升级,转向应用创造与经营平台
百度智能云在2026秒哒AI Day发布秒哒3.8,将平台从生成应用升级为覆盖设计、开发、测试、分发、增长、商业化的应用创造与经营平台。新增多环境切换、小程序发布预检、营销投流Agent、App接入微信支付、模板交易等功能,并上线行业商单平台连接需求方与创作者。官方称秒哒已累计服务超4000万用户、创造500万个应用,沙利文报告显示2026年上半年市场份额33.4%位居行业第一。
MeshyAI@MeshyAIAI 评分5353OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分4040 Cognition 用 GPT-6 Astra 让 Devin 测试自己的工作
Cognition 将 GPT-6 Astra 应用于 Devin 等产品线,提升其测试软件并展示结果的能力。Devin 用 Astra 测试 iPhone 游戏 Otter Run 时,会返回模拟器运行录像和标注通过项与未测项的测试报告;客户发来 bug 截图后,Devin 可修复并回传结果截图。Cognition 希望借此减少人工代码审查、加快交付。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3434 Perplexity 信任 GPT-6 Astra 处理端到端系统
Perplexity 联合创始人兼首席战略官 Johnny Ho 表示,GPT-6 Astra 可用于撰写沟通内容、修改真实系统并监控生产软件,这是前几代模型做不到的。他还让 GPT-6 Astra 围绕应用构建小型测试程序,模拟语言模型 API 或连接器等服务的真实响应,从而端到端验证工作流。Perplexity 因此能把完整端到端系统交给它,检查频率远低于前几代模型。
Google AI:DEV 作者专属(RSS)AI 评分5353 PostgreSQL 向量嵌入更新引发的 TOAST 膨胀实测与分表方案
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Epoch AI:研究、数据与评测精选AI 评分6060 Epoch AI 评审 ExploitBench v0.1:基于 41 个真实 V8 漏洞的利用基准评测
Epoch AI 发布对 ExploitBench v0.1 的基准评审,该基准用 41 个真实公开 V8 CVE,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行(ACE)。
推荐理由:Epoch AI 独立评审 ExploitBench 的评分设计与局限,读者可借此理解如何解读该基准的模型分数与污染风险。
ViggleAI@ViggleAIAI 评分3333Baseten 工程博客(网页)精选AI 评分7676 DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
ClaudeDevs@ClaudeDevsAI 评分2727