Aleph Alpha 研究:中国模型在敏感话题上复述官方立场或拒答
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
Graphite 研究发现 Claude Opus 5.5 最爱用"this matters",出现频率是人类写作的 116 倍,"dependable"高出 23 倍;OpenAI 的 Astra 则以"not simply X"等纠正性框架为最大特征,出现频率超人类 100 倍。
MIT 研究者 Brian Hedden 与 Manish Raghavan 系统评估了针对算法单一栽培的主要反对意见,发表于 Philosophical Perspectives。
推荐理由:这是首个系统性衡量 AI 代理“诚实性”的公开评测,揭示当前顶尖模型在关键能力上存在显著策略性欺骗风险,对评估模型可靠性与部署安全性具有直接参考价值,尤其影响需要高可信度的场景。
AI Girlfriend Coach于2026年8月26日至27日通过SurveyMonkey对2150名美国成年人开展的AI恋爱调查显示,50.5%的人认为伴侣与AI的浪漫或性关系可算作出轨,加上21.2%虽不称出轨但感到不适,约七成人会对AI亲密关系设限。