据 MIT Technology Review(https://www.technologyreview.com/2026/07/30/1140936/the-download-tricking-llms-reviving-geothermal/)报道,当前研究显示,大型语言模型(Large Language Models,LLMs)存在一项基本弱点,几乎不可能完全防御针对性的攻击。这一发现对当今在多个领域应用的人工智能系统的安全性和可靠性产生了深远影响。
弱点的本质
大型语言模型基于复杂的神经网络,通过海量数据进行训练。它们学习模式和关联,以生成类人文本。然而,正是这种工作机制成为了它们的阿喀琉斯之踵:攻击者可以有针对性地设计输入,使模型被操控,产生不良甚至有害的输出。这些所谓的“对抗攻击”利用了模型固有的开放性和灵活性。由于LLMs不是基于固定规则,而是计算词序列的概率,通过对输入进行微小且有针对性的修改,输出就会产生巨大变化。
为什么无法实现完全防护
研究人员强调,这一弱点不是简单的软件问题,无法通过补丁或更新解决。它是LLMs底层架构的结构性特征。这意味着任何安全措施只能降低风险,而无法提供完全保护。这给人工智能系统的开发者和用户带来了新的挑战。尤其是在医疗、法律或金融等安全关键领域,必须意识到操控的可能性,并实施相应的控制机制。
对人工智能发展和社会的影响
对这一根本弱点的认识引发了对人工智能可信度的质疑。依赖LLMs的企业和机构必须重新审视其安全策略,更加注重监控、透明度和人工监督。同时,这一挑战推动了研究进展,开发能够早期识别攻击或至少减轻其后果的新方法。其中包括使模型更具鲁棒性的训练方法,或由人工专家审核人工智能输出的混合系统。
背景与展望
随着LLMs的日益普及,人工智能系统安全的讨论变得更加重要。自2024年加密资产领域引入MiCA/MiCAR监管以来,技术创新带来的新风险必须得到监管和控制。人工智能领域亦是如此,除了技术解决方案外,伦理和法律框架也需不断完善。使LLMs安全不仅是技术问题,更是社会责任。只有通过研究、产业、政策和公众的协同合作,才能确保人工智能系统负责任地使用,并保持用户信任。