CoCoTen: Detecting Adversarial Inputs to Large Language Models through Latent Space Features of C...
文章主要内容和创新点主要内容本文针对大型语言模型(LLMs)易受越狱攻击(通过精心设计的提示词绕过安全协议,生成有害内容)的问题,提出了一种基于上下文共现张量潜在空间特征的检测方法——CoCoTen。该方法通过以下步骤实现检测:构建上下文共现矩阵:对输入提示词,在滑动窗口(通常5-10个token)内计算词与词的共现关系,生成共现矩阵;堆叠为张量:将多个提示词的共现矩阵堆叠为三维张量(维度为词汇量×词汇量×提示词数量);张量分解提取特征:使用CANDECOMP/PARAFAC(CP)分解张量,得到捕获提示词潜在特征的嵌入矩阵;半监督分类:基于嵌入矩阵,使用K近邻(KNN)算法(半监督学习)区分良性提示和越狱提示。实验结果显示,CoCoTen在少标签数据场景下表现优异(仅使用0.5%的带标签提示时,F1分数达0.83,较基线提升96.6%),且运行速度是基线方法的2.3-128.4倍,同时能通过词汇中心性对提示词的对抗性进行排序,为LLM安全防护提供了高效工具。创新点基于上下文共现张量的潜在特征提取:首次将上下文共现矩阵堆叠为张量,通过张量分解捕获提示词的深层结构模式,有效区分良性与越狱提示;适用于少标签数据场景:在仅使用0.5%-5