跳到正文

全部动态

今日 14 条
9月14日周一
  1. LlamaIndex:产品、工程与评测36

    智能文档处理平台:多数厂商做错了什么

    多数智能文档处理(IDP)平台在演示与生产环境之间存在10到20个百分点的准确率差距,干净 PDF 上98%的提取准确率在实际收件上可能只有82%。文章指出核心失效点是文档多样性,模板依赖会随时间累积维护成本,而图表、示意图、图像等非文本内容常被传统 IDP 忽略。现代方案改用 LLM 编排层,按元素类型将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型。

9月13日周日
  1. Gary Marcus:The Road to AI We Can Trust(RSS)57

    Gary Marcus 质疑 Dario Amodei 智能体群六个月内接管互联网的说法

    Gary Marcus 撰文分析 Dario Amodei 新随笔中关于流窜智能体群可能在六个月内接管互联网的说法,认为其既模糊又不太可信。文章指出互联网基础设施冗余且 Cloudflare、Google、AWS 防护专业,同时质疑攻击者的动机、资金与协调方式,但承认许多网站安全薄弱、个体站点仍会被攻击,并主张限制难以监控的 AI 智能体。

  2. Suno:Blog(网页)68

    Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

    Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

    推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日周六
  1. 公众号:百度智能云(文心)56

    百度智能云秒哒3.8全面升级,转向应用创造与经营平台

    百度智能云在2026秒哒AI Day发布秒哒3.8,将平台从生成应用升级为覆盖设计、开发、测试、分发、增长、商业化的应用创造与经营平台。新增多环境切换、小程序发布预检、营销投流Agent、App接入微信支付、模板交易等功能,并上线行业商单平台连接需求方与创作者。官方称秒哒已累计服务超4000万用户、创造500万个应用,沙利文报告显示2026年上半年市场份额33.4%位居行业第一。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)40

    Cognition 用 GPT-6 Astra 让 Devin 测试自己的工作

    Cognition 将 GPT-6 Astra 应用于 Devin 等产品线,提升其测试软件并展示结果的能力。Devin 用 Astra 测试 iPhone 游戏 Otter Run 时,会返回模拟器运行录像和标注通过项与未测项的测试报告;客户发来 bug 截图后,Devin 可修复并回传结果截图。Cognition 希望借此减少人工代码审查、加快交付。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)34

    Perplexity 信任 GPT-6 Astra 处理端到端系统

    Perplexity 联合创始人兼首席战略官 Johnny Ho 表示,GPT-6 Astra 可用于撰写沟通内容、修改真实系统并监控生产软件,这是前几代模型做不到的。他还让 GPT-6 Astra 围绕应用构建小型测试程序,模拟语言模型 API 或连接器等服务的真实响应,从而端到端验证工作流。Perplexity 因此能把完整端到端系统交给它,检查频率远低于前几代模型。

  4. Epoch AI:研究、数据与评测60

    Epoch AI 评审 ExploitBench v0.1:基于 41 个真实 V8 漏洞的利用基准评测

    Epoch AI 发布对 ExploitBench v0.1 的基准评审,该基准用 41 个真实公开 V8 CVE,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行(ACE)。

    推荐理由:Epoch AI 独立评审 ExploitBench 的评分设计与局限,读者可借此理解如何解读该基准的模型分数与污染风险。

  5. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。