Your current location:Home > Latest news text

功夫足球

AI 不需要永远正确,我们只需要守住最后一道底线_我的网站

银翼杀手

一 |     该图片使用了AI生成技术          本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs          现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错?          减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。         这些工作当然有价值。

二 |     R图 DJIA_0R图 NDX_0R图 SPX_0  8月26日,美股三大指数震荡整理,截至发稿,道指跌0.01%,纳指涨0.08%,标普500指数涨0.10%。         但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。         问题是,AI真的可能永远正确吗?          答案恐怕是否定的。R图 CL00Y_0  商品市场方面,国际油价跌幅收窄,截至发稿,WTI原油跌1%,报81.5美元/桶,此前一度跌超3%。
  全球要闻  美国7月核心PCE环比增长0.2% 符合预期  美国7月核心个人消费支出价格指数环比增长0.2%,预估为0.2%,前值为0.1%。         我们无法消灭所有错误          AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。

三 |          它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。美国7月核心PCE同比增长3.3%,预估为3.3%,前值为3.3%。

四 |   美伊停火谈判重大进展!伊朗拟设“霍尔木兹临时通航走廊”  当地时间周二,伊朗一名官员表示,伊朗与阿曼已达成协议,将临时重启霍尔木兹海峡通航;两国承诺,未来数月将继续谈判,敲定一套更具“永久性”的解决方案。与此同时,据消息人士向媒体爆料,美国与伊朗已就停火协议条款达成共识,其中包括霍尔木兹海峡自由通航。  关键指标显效:贝森特美债救市并非无用功?  美国财政部长贝森特上周宣布将通过扩大长债回购来压低美国融资成本,这一突如其来的计划虽然引发了关于其最终成效的激烈辩论,但关键的市场指标与机构持仓数据却似乎表明,该举措已开始初步显现成效。         即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。         我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。         试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。         真正的问题不是AI会不会犯错。         它一定会。数据显示,自贝森特上周宣布该计划以来,美国国债的表现已超越同期限利率互换,30年期的两者利差缩窄至了今年2月以来的最低水平。

五 |          真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。         模型错误不一定等于现实损失          一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。         但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。  美债最终恐无人接盘?美联储官员重磅警告 加息大门仍敞开  近期,美国长期国债收益率飙升至近20年高位引发担忧。         它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。         模型只是产生了一个错误判断。

六 | 美国里士满联储主席汤姆·巴尔金最新警告称,美国债务不断膨胀最终将引发一场清算,他指出“到某个时刻,人们会停止购买你的债务”。巴尔金表示,如果美国债务继续攀升,最终将不可避免地迎来一场“清算”,但具体时间点难以预测。

七 |          真正把错误变成事故的,是后面的执行能力。  加拿大宣布对美加征等额反制关税 涉700多种商品  加拿大联邦政府25日宣布,将对价值276亿加元(约合200亿美元)的700多种美国商品加征反制关税,同时推出总额为75亿加元(约合54亿美元)的企业和工人援助计划。加拿大联邦官员表示,本次受反制关税影响的美国商品总额与美方对加方加征的50%关税涉及商品价值相当,实现“等额、对等”反制。         模型犯错只是答案错了,执行失控才是真的出事。

八 | 加方关税反制措施将于9月8日正式生效。         这也是为什么,AI安全不能只盯着模型内部。  AI成下一个“大到不能倒”!白宫押上国运:压低利率成唯一解?  在美国,“大到不能倒”或许不再是银行的专属名词了。

九 | 过去几年,一场历史性的人工智能建设狂潮已深深融入美国的方方面面——从驱动股市屡创新高,到推高民众的公用事业账单,再到拉升美国国债收益率,无处不及。  公司新闻  连续四季不涨反跌!英伟达今夜放榜 该如何克服财报“魔咒”?  英伟达在过去一年中极其亮眼的盈利表现,不仅无形中抬高了华尔街对它的期望,也拉高了所谓“业绩超预期”的门槛,这使得该股陷入了一个令许多投资者感到困扰的“魔咒”:每逢英伟达公布季报后,越来越难有正面的股价回应……  美光科技:总裁兼CEO Mehrotra减持4万股 套现约3875.62万美元  美光科技董事长、总裁兼首席执行官MehrotraSanjay提交Form4持股变动声明。         我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。         这道底线不负责判断AI为什么犯错。8月21日,Mehrotra通过27笔交易合计减持4万股普通股,成交价格区间959.14至989.59美元,加权均价约968.90美元,套现约3875.62万美元。

十 | 减持后,Mehrotra直接持有公司普通股264503股。本次交易依据2026年1月30日制定的Rule10b5-1交易计划执行。  上海数据中心“人去楼空”?特斯拉中国回应:不实消息  日前,有网友爆料称,特斯拉专门为FSD(Full Self-Driving Supervised,监督版完全自动驾驶)入华筹备的上海数据中心已“人去楼空”,相关对接团队全部撤离。8月26日,《每日经济新闻》记者向特斯拉中国方面求证,一位内部人士回应称:“不实消息。         它只负责确认:这件事到底能不能发生。

十一 | ”  马斯克又画千亿美元“大饼”!SpaceX官宣建设地球最大发射场  继千亿美元的Terafab芯片厂项目后,世界首富马斯克的“画饼列表”中又多一个千亿美元级别的太空发射场项目。当地时间周二,美国路易斯安那州政府和SpaceX共同宣布,商业航天巨头计划投资1000亿美元,在该州南部建设一座巨型新发射场,占地面积约12.5万英亩。         守住钱袋子,比猜出所有骗子更现实          假设一个AI Agent正在替企业处理付款。

十二 |          我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。         但我们无法保证它永远认得骗子。SpaceX表示,该基地的设计目标是支持“每年数千次星舰飞行”。         骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。

十三 |   OpenAI自研芯片取得关键突破:响应速度、能效表现击败英伟达GB300  OpenAI声称其新款“Jalapeno”芯片在测试中的表现优于英伟达当前的产品阵容,凸显出该公司自主研发AI处理器取得的进展。OpenAI芯片业务负责人Richard Ho在接受采访时表示,该芯片与英伟达GB300进行了对比,该测试将GB300视为现有最领先的产品。

十四 | 即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。

十五 | 在测试中,Jalapeno在两个指标上占据优势:单位功耗所能处理的AI工作量,以及响应的速度。

十六 |          更现实的做法,是直接守住付款的底线:          单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。  史诗级IPO前再释炸裂数据!Anthropic预计潜在市场规模超30万亿美元  据媒体周二援引知情人士报道,Claude聊天机器人开发商Anthropic 或将向投资者表示,其总可寻址市场(TAM)超过30万亿美元。这一数据将超越 SpaceX 此前给出的28.5万亿美元的TAM估算,写下新的记录。。         这样,即使AI被欺骗,损失仍然会被限制。         你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。         这就是大道至简。         前面可以有复杂的模型、提示词、工作流和检测系统。         最后只需要一条明确的边界:          不符合条件,就不执行。         最后的系统不必比AI更聪明          很多人认为,保护AI的安全系统也应该是一套更强大的AI。         但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。         它只需要知道几个确定事实:          这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。         这些事实不满足,就拒绝。         安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。

十七 |          越靠近最终执行,系统反而越应该简单、独立和保守。         因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。

十八 |          真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。

十九 |          它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。

|          底线应该由人提前决定          当然,底线并不是系统自己创造的。         企业需要提前决定,什么事情绝对不能由AI单独完成。         可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。         这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。

|          真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。         AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。

|          但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。         AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。         未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。         我们没有必要因为它可能犯错,就拒绝所有自动化。

|          但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。

|          最后想和大家讨论一个问题:          对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权?          本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]

Current article:http://xo5i8.cuntoujuefourantapai.cfd/news/20260826_3635477.html

Published on:12:37:27


Related reading
Copyright © 2020-2099 功夫足球 All Rights Reserved 功夫足球 Copyright