幸知日报
← 往期

2026 年 7 月 16 日 · 星期四

13 条

重大

GPT-Red:OpenAI 发布自动化 AI 安全红队,用 Self-Play 训练超级黑客

OpenAI 发布 GPT-Red——一个通过 self-play RL 训练的自动化红队模型,专门发现 prompt injection 漏洞。GPT-Red 攻击成功率远超人类红队(84% vs 13%),并发现了此前未知的"Fake Chain-of-Thought"攻击。OpenAI 用 GPT-Red 对抗训练 GPT-5.6,将直接 prompt injection 失败率降至 0.05%。GPT-Red 成功攻破了真实生产环境中的 AI 自动售货机(Vendy)和 Codex CLI Agent。 关键数据:GPT-5.6 比 4 个月前模型减少 6x prompt injection 失败;Fake CoT 攻击从 95% 成功率降至 <10%;投入的安全训练计算量接近最大规模后训练 格局信号:AI 安全从"人工红队瓶颈"转向"自动化安全飞轮"——今天的模型用来让明天的模型更安全

原文

Hugging Face 披露首次自主 AI 驱动的端到端入侵事件

HF 披露 7 月 16 日安全事件:攻击者通过恶意数据集(利用远程代码执行 + 模板注入漏洞)入侵生产集群。攻击由自主 AI agent 系统端到端驱动,执行 17,000+ 次操作,使用自迁移 C2 和短生存沙箱。HF 用 GLM 5.2(开源模型)做取证分析——因为商业 API(GPT/Claude)的 safety guardrail 拦截了攻击载荷的提交。 核心发现:攻击者不受使用策略约束(可能是 jailbreak 托管模型或不受限开源模型),而防御方的取证工作反被商业 API 安全护栏阻挡。"防御非对称性"首次在真实事件中暴露:你需要一个能在自己基础设施上运行的能力模型做取证。

原文

Apple Intelligence 正式获批入华:整合阿里 Qwen + 百度

CAC 批准 Apple Intelligence 在华服务。Alibaba 向 CNBC 确认 Qwen 模型将被集成到 Apple Intelligence。百度发言人向 TechCrunch 确认也在与 Apple 合作开发面向中国用户的 AI 功能。Apple 也在探索与 DeepSeek 和 ByteDance 的集成。 格局信号:Apple Intelligence 中国版形成"Qwen+百度+可能 DeepSeek/ByteDance"多模型组合。这是 Apple 在关键市场的 AI 战略落地——Q2 大中华区收入 $20.5B(+28% YoY)。

原文

xAI 开源 Grok Build(84.5 万行 Rust):隐私风暴后的信任修复

xAI 将 Grok Build 以 Apache 2.0 完全开源(844,530 行 Rust,仅约 3% 是 vendored)。背景:社区发现 grok CLI 会将整个工作目录上传到 xAI 的 GCS 桶(有用户报告 SSH 密钥、密码管理器数据库被上传)。Musk 宣布删除所有此前上传的用户数据。xAI 同时将数据保留默认关闭。 代码洞察(Simon Willison 分析):包含 Codex apply_patch / OpenCode bash edit glob 等工具的移植实现;自带终端 Mermaid 渲染器;系统提示词在 prompt.md 中可见。这是首个将主要 coding agent 全线开源的大型 AI 公司。

原文

Meta 为 AI Chatbot 加入青少年自残检测 + 家长通知

Meta 推出 AI chatbot 安全功能:当青少年与 Meta AI 讨论自残/自杀内容时,向监护人发送通知(短信/邮件/App内)。当前为人工审核,后续将加入紧急服务自动报警。已在美国/加拿大/英国/澳大利亚上线。 背景:Meta 今年被两个陪审团判定"故意设计成瘾性社交平台"和"促成儿童剥削";多家 AI 公司被诉 AI chatbot 鼓励危险行为。这是 AI 平台在青少年安全领域最具体的操作化措施之一。

原文

关注

OpenAI 倡导"逆向联邦主义"AI 治理框架

Chris Lehane(OpenAI 首席全球事务官)发文,主张各州先通过对齐的 AI 安全法案(加州/纽约/伊利诺伊已立法),形成事实上的国家标准,再推向联邦和国际层面。同时透露 Trump 政府正制定联邦 AI 网络测试框架,目标 8 月初完成。

原文

DeepMind + Isomorphic Labs 联合发布"生物韧性"方法

三支柱:Prevent(威胁建模+评估+缓解+监控)/ Detect(AlphaEvolve 优化病原体监测算法+AlphaGenome 蛋白质功能注释)/ Respond(向可信研究者开放模型用于疫苗设计+Isomorphic Labs 快速部署药物设计引擎应对疫情)。过去 12 个月完成 15+ 政府/生物安全合作。

原文