提示注入 技术
提示注入通过在输入(网页、文档、外部数据)中隐藏恶意指令劫持 LLM 行为,使其泄露数据、执行危险操作或绕过安全策略,是 LLM 与 Agent 应用最普遍的攻防议题。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
提示注入通过在输入(网页、文档、外部数据)中隐藏恶意指令劫持 LLM 行为,使其泄露数据、执行危险操作或绕过安全策略,是 LLM 与 Agent 应用最普遍的攻防议题。
深度伪造(Deepfake)用生成式 AI 合成高度逼真的换脸/换声/虚拟人视频,带来虚假信息、敲诈与诈骗风险,各国以标识与检测(Deepfake 检测)应对。
个人信息保护指依法规范个人信息的收集、处理与利用,中国《个人信息保护法》(2021)确立知情同意、目的限制、最小必要与删除权等原则,是 AI 数据合规的基础法律。
差分隐私通过给查询结果加噪声,使输出对单个个体是否在数据集中不敏感(ε-DP),为数据分析与模型训练提供可证明的隐私保证,被苹果、谷歌与统计局采用。
隐私计算在数据「可用不可见」的前提下支持计算与建模,核心技术包括多方安全计算(MPC)、联邦学习、可信执行环境(TEE)与差分隐私,是数据要素流通的关键底座。
算法透明度要求 AI 系统的目的、逻辑、数据与限制对利益相关方可理解,是问责与信任的前提,落实为披露义务(算法备案)、模型卡与可解释接口。
可解释 AI(XAI)研究让人理解模型决策的方法:局部解释(LIME、SHAP)、全局解释(特征重要性、概念激活)与自解释模型,服务信任、调试与合规。
AI 公平性要求模型对不同群体一视同仁,通过统计指标(Demographic Parity、Equalized Odds、Calibration)度量并用再平衡、约束优化与后处理实现,是 AI 伦理的量化核心。
AI 偏见指模型系统性偏向特定群体或观点,源自训练数据、标注与算法设计,导致歧视性结果,缓解用公平性指标、数据去偏与审计,是 AI 伦理核心问题。
AI 幻觉指大模型生成看似合理但事实错误或无中生有的内容,源于概率生成与知识不确定性,缓解方法有检索增强、引用、事实核查与解码约束,是 LLM 部署的首要风险。
宪法式 AI 用一组「宪法原则」让模型自我批评与修订输出,减少对人工标注的依赖,是 Anthropic 训练 Claude 的核心对齐方法(2022)。
AI 对齐指让 AI 系统的目标与行为与人类的意图和价值观一致,RLHF、宪法式 AI、DPO 与可扩展监督是对齐的主要技术路线,是前沿 AI 安全的核心问题。
AI 安全研究如何确保 AI 系统可靠、可控且不产生伤害,涵盖技术安全(鲁棒性、对抗)与对齐安全(目标一致、价值观对齐),是前沿模型部署的核心议题。
AI 治理是通过政策、法规、标准与组织机制管理 AI 风险并促进可信 AI 的体系,涵盖分级分类监管、安全评估、审计与责任机制,欧盟 AI 法案是标志性立法。
AI 伦理研究人工智能开发与应用中的道德问题:偏见、公平、隐私、可解释、责任与自主性边界,通过原则(可解释、公平、透明、可问责)与法规(欧盟 AI 法案)落地。