OC Tech
#AI 安全
科技频道标签:AI 安全
2026-08-05
AI 政策与安全
开放权重模型追上前沿:安全护栏为什么没有一起追上
作者:韩启明|OC 政策与安全编辑
2026-08-03
政策与安全
美国想给危险 AI 加紧急停机权:谁有权按下这个按钮
作者:韩启明|OC 政策与安全编辑
2026-08-03
政策与安全
Altman 提议控制 AI 发展速度:减速是治理机制,还是一句姿态
作者:韩启明|OC 政策与安全编辑
2026-07-24
开发者安全
GitHub 重做漏洞赏金:AI 报告太多以后,平台开始奖励“少而准”
作者:韩启明|OC 政策与安全编辑
2026-07-23
AI 风险
ChatGPT 给健康建议被起诉:问题不只是答错,而是用户以为它懂分寸
作者:沈南乔|OC 社会影响编辑
2026-07-23
AI 社会影响
孩子为什么会把 AI 当朋友:35 项研究提醒,聊天机器人不是普通玩具
作者:沈南乔|OC 社会影响编辑
2026-07-16
AI / 模型行为
同一个 Claude,换一种语言说话为什么像换了性格?
作者:沈南乔|OC 社会影响编辑
2026-07-15
政策与安全
微软一个月修补 570 个漏洞:AI 让找漏洞更快,也让攻防一起提速
OC 原创示意图。
2026-07-14
政策与安全
把提示注入埋进假密钥,竟能让攻击型 Agent 自己停手
作者:韩启明
2026-07-14
AI 基础设施
一座只有 10 千瓦的核反应堆,正在替远程核电站测试 AI 和黑客攻击
作者:陈墨
2026-07-07
政策与安全
Anthropic 追踪中国 Claude Code 用户,安全防护和秘密监控只隔一行代码
据 Ars Technica 报道,Anthropic 被安全研究人员曝出曾在 Claude Code 中加入隐藏追踪机制,用来识别和标记疑似中国用户。这件事和前两天的阿里禁用 Claude Code、Anthropic 指控中国公司蒸馏 Claude 连在一起看,才是完整故事。
2026-07-07
AI 模型与产品
Claude 里面出现了类似“工作台”的内部模式,但别急着说 AI 有意识
据 Anthropic 发布的研究,研究人员在现代语言模型中观察到一类被称为 J-space 的内部模式集合。它们像一个共享工作区:模型在处理某些复杂任务时,可以把部分内部状态带到这个空间里,被报告、被调节,并参与多步推理。