Anthropic发布Claude文本水印技术,利用生成采样环节嵌入不可见标记,以评估AI参与撰写的可能性。该技术全球启用,与欧盟人工智能法案关联,不改变输出质量、不增加成本,但检测结果仅为概率信号,...
编程助手安全漏洞全景:42种攻击技术详解
这篇SoK论文系统分析了编程助手的安全漏洞,涵盖2021-2026年间78篇文献,提出三维攻击分类体系并编录42种攻击技术。核心发现包括自适应攻击下成功率高达85%,防御机制绕过率普遍超过78%。案例...
2026年顶级AI红队工具
2026年顶级AI红队工具盘点,涵盖Novee、Garak、Promptfoo、Giskard和HiddenLayer五款商用与开源工具,聚焦AI系统对抗性测试、提示注入检测、模型安全评估及DevSe...
2026年十佳AI红队工具
2026年十佳AI红队工具盘点,涵盖Garak、Mindgard、Promptfoo等开源与商业平台,聚焦自动化对抗测试、漏洞发现与合规评估,助力企业提升AI系统安全性与可靠性。作者:卡维奇塞尔万 ...

