跳到正文

全部动态

今日 3 条
9月4日周五
  1. Gary Marcus:The Road to AI We Can Trust(RSS)74

    Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑

    Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。

    推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。

  2. -Zho-40

    ZHO 刷了大量 GPT-6 Astra 提前测试案例后评价,其惊艳点在于通过建模/渲染软件实现高质量 3D 建模和渲染,建筑与游戏均适用。作为职业建筑师,他认为这并不惊艳,早在 2023 年就提出 AI 能生成真实照片后就不再需要效果图;如果 GPT-6 真的足够强,应重建全新的工作逻辑和链路,而不是更好地完成旧链路,那才是迈向 AGI 的起点。

  3. Sherwin Wu66

    Sherwin Wu 表示自己曾觉得 ARC-AGI-3 很难,如今该基准已被 Astra 饱和。引用 François Chollet 的话称,ARC 3 发布时他预计前沿模型约一年才能饱和,实际只用了 6 个月,约为预期的 2 倍速度,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点。

    推荐理由:结合 Arc Prize 负责人的预估与半年即饱和的结果,读者可以借此对照自己对前沿模型进展速度的预期。

  4. François Chollet62

    François Chollet 表示,ARC-AGI-3 于今年 3 月发布时前沿模型得分低于 1%,曾引发部分人质疑基准本身有问题、聪明人类也无法得高分。他称基准校准良好,认真投入的普通人应能得 90% 以上,表现优于其人类基线即可得 100%;AI 在 6 个月内从 <1% 提升到 100%,显示该基准记录了智能体能力的快速上升,这一速度超出包括他们自己在内多数人的预期。

  5. Ethan Mollick48

    Ethan Mollick 让 GPT-6 阅读他数万封邮件、 writings 和日程,自主下载软件、制定策略,在五天不间断工作中无需干预地构建了数 GB 的个人 wiki,涵盖研究、联系人、想法和任务。现在该 AI 每天两次交叉核对新邮件并发送摘要简报。他提醒授权访问自己电脑存在风险需谨慎,试用期内 token 未收费,因此无法告知完整成本但可能相当可观,日常简报 token 消耗不大。