会痛的十七岁

AI 不需要永远正确,我们只需要守住最后一道底线_我的网站

中国合伙人

一 |     该图片使用了AI生成技术          本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs          现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错?          减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。         这些工作当然有价值。    जागरण संवाददाता, हापुड़। वंदे भारत एक्सप्रेस ट्रेन का सफर आज 27 अगस्त से वाराणसी तक शुरू हो गया है। यह विस्तार न केवल मेरठ, हापुड़ और आसपास के क्षेत्रों के यात्रियों के लिए सुविधाजनक है, बल्कि अयोध्या धाम और काशी विश्वनाथ धाम जैसे तीर्थस्थलों की यात्रा करने वाले श्रद्धालुओं के लिए भी वरदान साबित होगा।,इस ट्रेन के लिए यात्रियों ने पहले ही रिजर्वेशन करा लिया है, जिससे उत्साह और सुविधा की उम्मीद और बढ़ गई है। वंदे भारत एक्सप्रेस के हापुड़ रेलवे स्टेशन पर इसके ठहराव की मांग इसके संचालन से ही जोर पकड़ रही थी।,पिछले माह मेरठ-लखनऊ वंदे भारत एक्सप्रेस को हापुड़ रेलवे स्टेशन पर दो मिनट का ठहराव दिया गया था। इस सुविधा ने मुरादाबाद, बरेली और लखनऊ जाने वाले यात्रियों को आवागमन में काफी राहत प्रदान की। अब, इस ट्रेन के मार्ग को वाराणसी तक विस्तारित करने का निर्णय लिया गया है, जो पश्चिमी और पूर्वी उत्तर प्रदेश के बीच कनेक्टिविटी को और मजबूत करेगा। वंदे भारत एक्सप्रेस (ट्रेन नंबर 22490) मेरठ सिटी से सुबह 6:35 बजे रवाना होगी और सुबह 7:08 बजे हापुड़ रेलवे स्टेशन पहुंचेगी। दो मिनट के ठहराव के बाद यह ट्रेन मुरादाबाद (8:35-8:40 बजे)। बरेली (10:04-10:06 बजे), लखनऊ चारबाग (1:45-1:55 बजे) और अयोध्या धाम (3:53-3:55 बजे) होते हुए शाम 6:25 बजे वाराणसी कैंट पहुंचेगी। यह ट्रेन 782.22 किलोमीटर की दूरी 11 घंटे 50 मिनट में तय करेगी। वापसी में (ट्रेन नंबर 22489) यह ट्रेन वाराणसी कैंट से सुबह 9:10 बजे रवाना होगी और अयोध्या धाम (11:40-11:42 बजे), लखनऊ (1:40-1:50 बजे), बरेली (5:13-5:15 बजे) और मुरादाबाद (6:50-6:55 बजे) होते हुए रात 8:10 बजे हापुड़ पहुंचेगी। यह ट्रेन रात 9:05 बजे मेरठ सिटी पहुंचकर अपनी यात्रा पूरी करेगी।。         但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。         问题是,AI真的可能永远正确吗?          答案恐怕是否定的。         我们无法消灭所有错误          AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。         它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。         即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。         我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。         试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。         真正的问题不是AI会不会犯错。         它一定会。

二 |          真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。         模型错误不一定等于现实损失          一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。         但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。         它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。         模型只是产生了一个错误判断。         真正把错误变成事故的,是后面的执行能力。         模型犯错只是答案错了,执行失控才是真的出事。

三 |          这也是为什么,AI安全不能只盯着模型内部。         我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。         这道底线不负责判断AI为什么犯错。         它只负责确认:这件事到底能不能发生。

四 |          守住钱袋子,比猜出所有骗子更现实          假设一个AI Agent正在替企业处理付款。         我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。         但我们无法保证它永远认得骗子。

五 |          骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。         更现实的做法,是直接守住付款的底线:          单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。         这样,即使AI被欺骗,损失仍然会被限制。         你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。         这就是大道至简。         前面可以有复杂的模型、提示词、工作流和检测系统。         最后只需要一条明确的边界:          不符合条件,就不执行。         最后的系统不必比AI更聪明          很多人认为,保护AI的安全系统也应该是一套更强大的AI。         但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。         它只需要知道几个确定事实:          这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。

六 |          这些事实不满足,就拒绝。         安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。         越靠近最终执行,系统反而越应该简单、独立和保守。         因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。         真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。

七 |          它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。         底线应该由人提前决定          当然,底线并不是系统自己创造的。         企业需要提前决定,什么事情绝对不能由AI单独完成。         可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。         这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。

八 |          真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。         AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。         但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。         AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。         未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。

九 |          我们没有必要因为它可能犯错,就拒绝所有自动化。         但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。         最后想和大家讨论一个问题:          对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权?          本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]

Current article:http://zlhx1.zangjiwuqihuncongcherua.cyou/news/20260826_4858.html

Published on:00:00:00