全部AI 动态
全部动态
今日 2 条
elvis@omarsar0AI 评分2727
-Zho-@ZHO_ZHO_ZHOAI 评分1010Hacker News:AI 热帖精选AI 评分8686 Claude Opus 5.5 提示词指南:与 Opus 5 的行为差异及迁移模式
Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。
推荐理由:官方文档梳理了从 Claude Opus 5 迁移到 5.5 时的具体提示词与 harness 调整点,可直接对照排查现有集成的问题。
Dongxi 东锡 NLP@dongxi_nlpAI 评分4545公众号:数字生命卡兹克AI 评分4545 GPT-Image 2.5 的12种照片编辑与创意玩法教程
文章介绍了利用 GPT-Image 2.5 模型进行照片精准编辑和创意生成的12种具体玩法,包括消除背景游客、自动调光、专业美颜、制作3D公仔拍立得、景点明信片、主体贴纸化、旅游碎片行李箱、人物海报、演唱会氛围感照片、美食飞溅效果、物体转文字涂鸦及Ins风注释等。每种玩法均提供了详细的提示词示例和操作步骤,旨在帮助用户在假期通过AI优化朋友圈照片。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 Reasonable 团队解读 TLA+:从 Boris Cherny 热传推文到机器可验证软件
Reasonable 团队撰文介绍 TLA+ 是什么,回应 Boris Cherny 用 Opus 5.5 将 Claude Agent SDK 部分建模为 TLA+ 和 Lean 的热传推文。
elvis@omarsar0AI 评分5555
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 Privatemode 团队用 GLM-5.3-Flash 将 LLM 变成单次前向的类型化决策模型
Privatemode 团队展示了一种无需微调的方法,通过编号选项、预填 choice_index: 前缀并读取选项索引的 log 概率,让 GLM-5.3-Flash 在单次前向中输出带概率的类型化决策。
凡人小北@frxiaobeiAI 评分5454HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从症状、检查聊到治疗和后续安排。
Simon Willison 博客AI 评分6262 Simon Willison 用 Claude Opus 5.5 生成鸮鹦鹉像素动画并用 Claude Code 录成视频
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕主题演讲前,用 Claude Opus 5.5 根据三张鸮鹦鹉照片生成至少 20 只鸮鹦鹉开派对的 HTML 5 canvas 像素动画页面。
Hacker News:AI 热帖AI 评分6666 brumar 开源 Claude Code 国际象棋复盘 Skill,结合 Stockfish 与思考录音生成解说视频
作者 brumar 发布一套 Claude Code skills,将 lichess 对局结合 Stockfish 引擎生成可读的复盘报告和带旁白的解说视频。
IT之家(RSS)AI 评分7676 Anthropic 发布 Opus 5.5 迁移指南:Agent 半路停工的四类原因与三招续跑方案
Anthropic 发布 Opus 5.5 配套指南,解释 Agent 无人值守时常在汇报完进度后停在半路,原因是模型爱发汇报、旧程序把 end_turn 当成任务完成。
公众号:卡尔的AI沃茨AI 评分4545 实测LibTV 1.5五大新功能,演示AI短剧工作流
作者详细测试了LibTV 1.5版本的新功能,包括将Agent升级为TV Director、剧本原创及改编、角色造型室、导演执导、3D-BOX预演和创意片头。文章展示了从生成50集古装言情喜剧大纲、手动编辑剧本、使用角色造型室调整人物形象,到利用Seedance 2.5生成分镜、通过导演模式优化镜头以及用3D-BOX进行复杂运镜预演的完整流程,最终输出成片。
Hacker News:AI 热帖AI 评分5959 作者分享用 logprobs 读取 LLM 选项概率的单函数封装,并扩展到视觉模型
作者受 Jev 及 OpenJev、SemIf 启发,实现了一个单函数封装:让 LLM 只生成一个选项字母,再读取 top_logprobs 得到各选项概率。
elsewhere:文章(RSS)AI 评分5757 Today AI 实测:一个创作者与 Personal AI 助理相处一周的体验
十字路口团队实测了 9 月在国内开放的 Personal AI 助理产品 Today AI,覆盖 macOS、Windows、Linux、iOS 四个平台。
MarkTechPost(RSS)AI 评分5757 用 AugLy 构建图像、文本、音频多模态数据增强与对抗鲁棒性基准教程
本教程基于 AugLy 构建覆盖图像、文本、音频的端到端多模态数据增强与鲁棒性工作流。教程解决依赖兼容问题,生成确定性合成数据集,演示 AugLy 的函数式与类式 API。
GitHub Blog精选AI 评分6363 GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流
GitHub 官方博客发布 GitHub Copilot app 新手教程,介绍用 /create-canvas 技能通过自然语言描述生成可自定义的 canvas 界面。
推荐理由:教程来自 GitHub Copilot 官方博客,讲解了用 /create-canvas 生成双向共享界面的具体做法,适合想定制智能体工作流的读者上手。
GitHub Blog精选AI 评分6464 GitHub 如何通过迁移 CSS Modules 将 SSR 时间降低 55%
GitHub 工程师 Josh Black 复盘将 Primer 设计系统从 CSS-in-JS 迁移到 CSS Modules 的历程。截至 2024 年 12 月 Primer 全部组件迁移完成,服务端渲染时间减少 55%,组件初始化时间减少 25%。
推荐理由:原文给出大厂从 CSS-in-JS 迁移到 CSS Modules 的完整路径和量化收益,可迁移到类似的前端架构改造。
Google AI:DEV 作者专属(RSS)AI 评分5353 Postgres 中向量内联存储与独立表对比:AlloyDB Omni 实测 join 开销
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
Artificial Intelligence News(网页)AI 评分5656 为什么 AI 工作负载在排队而 GPU 看似闲置:Kubernetes GPU 分配问题解析
文章解释 AI 工作负载在 GPU 看似闲置时仍排队的原因:利用率指标只反映计算活动,不代表容量可用。Kubernetes 默认独占分配整块 GPU,此外内存占用、放置约束和应用层瓶颈也会造成排队。
Arena.ai@arenaAI 评分5656Arena 宣布 Grok 4.7 (xHigh) 进入 Agent Arena 榜单第16位,净改进分 +3.96%。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6262 Opus 5.5 制作讲解视频的开源 agent 方案 shipvideo 发布
作者发布 launchvideo.io 与 diggerhq/shipvideo 仓库,用 anthropic/claude-opus-5.5 通过 OpenComputer serverless agent 把一个 URL 或提示词直接渲染成 MP4 讲解视频,单次运行无人工编辑。
Arena.ai@arenaAI 评分6161GitHub Blog精选AI 评分6464 GitHub Security Lab 发布 LLM 驱动的 Fuzzing Taskflow,自动完成 C/C++ 项目模糊测试全流程
GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。
推荐理由:作者开源了完整的自主模糊测试流水线,并讲清覆盖反馈、结构感知和崩溃分诊的设计取舍,C/C++ 维护者可直接复用。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7777 安全研究者披露黑客用 GEO 污染 ChatGPT、Gemini 和 Google AI Overview,374 家企业被植入诈骗联系方式
安全研究者发现针对 ChatGPT、Gemini 和 Google AI Overview 的规模化 AI 虚假信息攻击,共检测到 374 家被攻击企业,包括 Delta、Lufthansa、Bank of America、Airbnb 等,AI 会向用户给出诈骗电话和钓鱼链接。
推荐理由:安全团队用自建检测系统实测三家 AI 的答案污染,给出攻击手法拆解和平台不受理的现状,读者可了解这类新攻击面如何运作。
The Decoder:AI News(RSS)AI 评分6666 研究显示 AI 基准性能成本每年降至约十三分之一,MIT 估算纯算法效率约每年 3 倍
Epoch AI 估算,在固定基准分数上取得同等性能的市场价格平均每季度下降约 47%,约合每年 13 倍。OpenAI 的 o3 在 2025 年初以每题约 30 美分在 GPQA Diamond 达到 75% 准确率,18 个月后 GPT-5.6 系列模型以原价 1/725 达到同样分数。
Peter Steinberger 🦞@steipeteAI 评分6363
Hacker News:AI 热帖AI 评分6464 按预算挑选最优 LLM 的每日更新对照表
作者 terryds 上线 bestmodelforyourbudget 网站,每日用 Artificial Analysis 免费 API 数据更新按预算选 LLM 的对照表。
Google Developers Blog(RSS)AI 评分5151 Google 团队在 TPU 上用 MaxText 复现 Ai2 的 Olmo 3 7B 预训练
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
IT之家(RSS)AI 评分7575 Waymo 公布 2.71 亿英里自动驾驶数据:严重事故比人类驾驶员少 95%
Waymo 公布其 Robotaxi 在亚特兰大、奥斯汀、菲尼克斯、洛杉矶和旧金山累计 2.71 亿英里无人驾驶里程的分析结果:致重伤及以上事故的概率比人类驾驶员低 95%,致轻伤事故低 82%,致伤事故比按人类事故率推算的少 841 起。
Arena.ai@arenaAI 评分6868公众号:卡尔的AI沃茨AI 评分6262 五大场景实测商汤SenseNova U1 Pro:从审美到多图融合的生图能力评测
商汤上线SenseNova U1 Pro,在8月SuperCLUE-Image中文文生图榜单以总分93.81排名第一,作者实测其与gpt image 2.5对比。作者分审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合五类任务测试,附全部提示词,认为其文字稳定、局部编辑精准、可支持8K输出,整体完成度达到可交付水平,考虑替换进自己的图片工作流。
Google AI:DEV 作者专属(RSS)AI 评分5151 用 google-cloud-developer 插件让智能体按 Google Cloud 最佳实践完成部署实测
Remigiusz Samborski 用 Antigravity CLI 实测 Google 的 google-cloud-developer 插件,一条命令安装五个技能和 Developer Knowledge MCP 服务器,支撑 Claude Code、Codex CLI 等智能体。
公众号:卡尔的AI沃茨AI 评分7171 实测GPT-6 Sol、Luna与Claude Opus 5.5:编程、前端、写作与3D多模态对比
作者实测GPT-6 Sol、Luna与Claude Opus 5.5三款新模型。GPT-6 Sol/Luna API价格比GPT5.6低50%,Opus 5.5输出速度比Opus5快30%、成本低40%,并提升了pro、max、team套餐的五小时额度窗口。
公众号:卡尔的AI沃茨AI 评分7474 实测小米 MiMo-V2.6 系列模型:开源分第一,价格低至同级海外模型的几十分之一
小米发布 MiMo-V2.6-Pro、Flash 和 Pro-UltraSpeed 三款模型,UltraSpeed 输出速度最高达 Pro 的 20 倍。
Artificial Analysis@ArtificialAnlys精选AI 评分6868推荐理由:原文给出 Opus 5.5 在三项编码评测的具体分数、token 用量和任务成本,读者可以据此权衡性能与价格。
Hacker News:AI 热帖AI 评分5454 Mercury 2.5 评测数据:770 tokens 每秒输出、260k 上下文、智能指数 12
Artificial Analysis 页面显示,Inception 于 2026 年 9 月发布的 Mercury 2.5 是一个推理模型,输出速度达 770.4 tokens 每秒(同类价格档推理模型中位数为 108.6)。
Thariq@trq212AI 评分6464
ClaudeDevs@ClaudeDevs精选AI 评分5151推荐理由:作者分享了用 Claude 测量、调试并提升 claude.ai 性能的具体方法,并附上提示词,读者可参考复用。
Boris Cherny@bchernyAI 评分5757