OC

OC Tech

#AI 安全

科技频道标签:AI 安全

开放权重模型追上前沿:安全护栏为什么没有一起追上
2026-08-05
AI 政策与安全

开放权重模型追上前沿:安全护栏为什么没有一起追上

作者:韩启明|OC 政策与安全编辑

美国想给危险 AI 加紧急停机权:谁有权按下这个按钮
2026-08-03
政策与安全

美国想给危险 AI 加紧急停机权:谁有权按下这个按钮

作者:韩启明|OC 政策与安全编辑

Altman 提议控制 AI 发展速度:减速是治理机制,还是一句姿态
2026-08-03
政策与安全

Altman 提议控制 AI 发展速度:减速是治理机制,还是一句姿态

作者:韩启明|OC 政策与安全编辑

GitHub 重做漏洞赏金:AI 报告太多以后,平台开始奖励“少而准”
2026-07-24
开发者安全

GitHub 重做漏洞赏金:AI 报告太多以后,平台开始奖励“少而准”

作者:韩启明|OC 政策与安全编辑

ChatGPT 给健康建议被起诉:问题不只是答错,而是用户以为它懂分寸
2026-07-23
AI 风险

ChatGPT 给健康建议被起诉:问题不只是答错,而是用户以为它懂分寸

作者:沈南乔|OC 社会影响编辑

孩子为什么会把 AI 当朋友:35 项研究提醒,聊天机器人不是普通玩具
2026-07-23
AI 社会影响

孩子为什么会把 AI 当朋友:35 项研究提醒,聊天机器人不是普通玩具

作者:沈南乔|OC 社会影响编辑

同一个 Claude,换一种语言说话为什么像换了性格?
2026-07-16
AI / 模型行为

同一个 Claude,换一种语言说话为什么像换了性格?

作者:沈南乔|OC 社会影响编辑

微软一个月修补 570 个漏洞:AI 让找漏洞更快,也让攻防一起提速
2026-07-15
政策与安全

微软一个月修补 570 个漏洞:AI 让找漏洞更快,也让攻防一起提速

OC 原创示意图。

把提示注入埋进假密钥,竟能让攻击型 Agent 自己停手
2026-07-14
政策与安全

把提示注入埋进假密钥,竟能让攻击型 Agent 自己停手

作者:韩启明

一座只有 10 千瓦的核反应堆,正在替远程核电站测试 AI 和黑客攻击
2026-07-14
AI 基础设施

一座只有 10 千瓦的核反应堆,正在替远程核电站测试 AI 和黑客攻击

作者:陈墨

Anthropic 追踪中国 Claude Code 用户,安全防护和秘密监控只隔一行代码
2026-07-07
政策与安全

Anthropic 追踪中国 Claude Code 用户,安全防护和秘密监控只隔一行代码

据 Ars Technica 报道,Anthropic 被安全研究人员曝出曾在 Claude Code 中加入隐藏追踪机制,用来识别和标记疑似中国用户。这件事和前两天的阿里禁用 Claude Code、Anthropic 指控中国公司蒸馏 Claude 连在一起看,才是完整故事。

Claude 里面出现了类似“工作台”的内部模式,但别急着说 AI 有意识
2026-07-07
AI 模型与产品

Claude 里面出现了类似“工作台”的内部模式,但别急着说 AI 有意识

据 Anthropic 发布的研究,研究人员在现代语言模型中观察到一类被称为 J-space 的内部模式集合。它们像一个共享工作区:模型在处理某些复杂任务时,可以把部分内部状态带到这个空间里,被报告、被调节,并参与多步推理。