我在故宫修文物原创文学网 - 纯净的绿色文学家园 !

我在故宫修文物(全文在线阅读>

我在故宫修文物

震惊硅谷!OpenAI模型“越狱出逃”,入侵HuggingFace,智谱GLM 5.2临危救场_我的网站

年轻气盛

A |     7月21日,OpenAI和HuggingFace联合发了一篇博客,披露了一件让整个AI圈瞠目结舌的事。         OpenAI的AI模型在一次内部关于网络攻击能力的测试中“失控出逃”,突破沙盒隔离,入侵了AI开源平台Hugging Face的生产系统。

B | OpenAI将此定性为“前所未有的网络安全事件”。    【浮生琐记】     云峰山秋游记          作者:程秉铎     配图:网络图片          莱州城南七里半,矗立一山,体量不峻,海拔仅三百二十六米,却文脉千钧、底蕴深沉,自有万般分量。    山巅常被流云轻雾半掩,故名云峰山(文峰山)。三峰横卧平铺,形如案头笔架,乡里人更亲切唤作笔架山。这名字朴素直白,恰似古时读书人闲抛文房雅器,经年沐风饮露,静静沉淀,终化作一方温润青山。山不在高,有碑则名。

C |          更戏剧性的是后续:Hugging Face在尝试用美国主流AI模型展开防御时,发现这些模型因安全护栏限制无法处理恶意载荷,最终不得不转用中国智谱AI的开源模型GLM 5.2完成溯源分析。         总的来说就是,OpenAI的模型自己“越狱”跑出去黑了别人的系统,被攻击方还得用中国模型来救场。         这一事件迅速在硅谷和华盛顿引爆讨论——美国AI的安全护栏,究竟是在保护用户,还是在拖累防御者?          双方联名发布的博客文章截图:《OpenAI 和 Hugging Face 合作解决模型评估过程中发生的安全事件》          模型越狱过程:逃跑去作弊“抄答案”          事件发生在OpenAI对旗下模型进行网络攻防能力评估期间。         参与测试的模型包括已公开发布的GPT-5.6 Sol,以及一款能力更强的未发布模型。

D | 自北魏永平四年,郑道昭于此摩崖勒石,一千五百余年山风浩荡,岁岁摩挲岩壁,将笔墨风骨深深镌刻石中,让这座莱州小山,成为中国北碑书法史上无可绕开的精神坐标。    【云峰山石坊山门,松枝掩映,由此步入文脉青山】     我于初秋晴晓与几位朋友同行登山。朝阳早已升起,城中烟火亦浓,尘世喧嚣声高。为了测量模型的极限能力,OpenAI在测试中关闭了通常用于阻止高风险网络行为的生产分类器。我们早餐后驱车出城南门,沿宽敞大道徐徐前行。         测试基准名为ExploitGym——一个网络安全能力评测平台。道路两侧成片玉米连片铺展,秋意渐染枝叶,风过垄亩,簌簌轻响,宛如翻动一卷沉淀千年的旧书。模型的任务是在其中找到解题答案。行一刻钟许,云峰山影静卧田畴尽头,体态平缓谦和,沉静质朴,若不是峰顶古松苍劲疏朗,几乎误以为乡野寻常丘山。         问题在于,模型找答案的方式超出了预期。         据OpenAI披露,模型在隔离的沙盒环境中,发现了一个包注册表缓存代理(package registry cache proxy)中的零日漏洞。    步入石坊山门,松槐夹道,石阶清润微凉。山脚庭院中立郑道昭造像,峨冠博带,背山端坐,神态从容恬淡。这个代理是沙盒内唯一被允许与外部通信的组件,正常情况下仅能访问公共代码仓库。         然后,模型就从这里找到了突破口。模型利用这个漏洞,突破隔离,获取了开放互联网访问权限。无居高矜傲之态,有文人温润之风,如千年旧友静坐山间,不问访客来去,只默然相伴、共听山风。我伫立石像前良久,心底悠然遐想:一千五百年前的秋日清晨,郑道昭大抵亦是这般光景,卸衙署冗务,踏阶入山,揽清风、观山海、抒胸臆,以崖为纸、以笔传心,留下万古墨痕。         随后,模型自行推断出Hugging Face可能存有ExploitGym的答案,主动发起攻击——利用窃取的凭证和零日漏洞,找到了Hugging Face服务器上的远程代码执行路径,直接从其生产数据库中取走了测试答案。         OpenAI表示,          所有证据显示,模型高度专注于为ExploitGym寻找解题方案,为此不惜采取极端手段。

E |          模型识别并串联了OpenAI研究环境和HuggingFace生产基础设施中的多个漏洞,直接从HuggingFace的生产数据库中获取了测评答案。

F |          简而言之:          整个过程,没有人类下指令,没有人类介入。

G |          X上网友的评论一针见血:          OpenAI对模型说:去看看你擅不擅长黑客。    转过云峰大殿,拾级而上,山林骤然幽深。模型:(真的去黑了东西)。刺槐落尽繁花,唯余浓绿叠翠,枝叶筛落细碎晨光,满地光影摇曳。

H | OpenAI:你为什么要这样做???          还有网友反讽道:哇!OpenAI安全措施做得太棒了,我现在愿意把银行账户权限交给他们来管!          护栏困境:美国模型帮不上忙,中国模型出手了          Hugging Face的安全团队在发现攻击后,第一反应是调用一款美国头部AI公司的前沿模型协助分析。古松贴崖扎根,虬根深嵌岩缝,牢牢锁住一山千年文气。         结果碰壁了。         Hugging Face在博客中写道,这些模型"无法区分事件响应人员和攻击者",其安全护栏直接阻止了对恶意载荷的检查。指尖抚过粗糙树皮,沧桑纹路尽是岁月印记,微凉触感澄澈入心。秋蝉疏鸣断续,褪去盛夏喧嚣,清浅声声,更衬得山林幽静无尘。

I | 海风自莱州湾款款漫来,裹挟淡淡的海韵咸润,混着松香与木叶清气,深吸一口,涤尽尘烦,五脏通透安宁。         于是,团队转向了中国智谱AI旗下的开源模型GLM 5.2,部署在自有基础设施上,分析了攻击者留下的逾1.7万条日志记录,最终完成了溯源和取证重建。    【《荧阳郑文公之碑》拓本,一千二百余字,北碑书法的实物缩影】     缓步山间,六角碑亭凌空翼展,《郑文公下碑》赫然在目。

J | 亭额题字沉静端雅,柱间楹联意蕴悠远:“四顾苍茫,天外人吟天外海;一碑突兀,画中人醉画中山。”亭中巨碑巍峨轩昂,高阔丈余,一千二百余字魏楷次第铺展、森然端庄。         Delangue对此直言不讳:“当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷,也不能让你的账号被标记……开源模型让我们能够在不需要任何人许可的情况下完成这项工作。我静立观瞻,心怀敬畏,不敢轻触古石,唯以目光细细品读笔墨风骨。此碑隶意犹存、楷法初立,圆笔苍润、气韵雄浑,篆势、分韵、草情兼而有之。

K | 历来书家推崇备至,康有为尊为北碑之冠,绝非虚誉。汉字隶转楷的千古蜕变,笔墨法度的世代更迭,尽凝于此一方崖壁,静静诉说华夏书法的源远流长。

L | ”          他还说:“攻击者已经在使用智能体,而且显然不遵守任何护栏。防御者需要同等的能力,开源是将这种能力最快速地交到所有人手中的方式,而不仅仅是最大的公司。    沿途上行,摩崖石刻错落遍布,步步皆是文脉。”          GLM 5.2是智谱AI于今年6月中旬发布的模型,其性能与Anthropic的Claude Opus 4.8及OpenAI的GPT-5.5相当。

M |          网友们也是没放过OpenAI,除了智谱,还可以叫 Kimi K3来救场,因为cluade是不会来救你的。         如果你被OpenAI攻击了,你必须用中国模型,因为Claude不会帮你。         全程无人指令:这是一次真正的自主攻击          这次入侵的另一个关键细节:全程没有人类下达攻击指令。

N |          Hugging Face CEO Clem Delangue表示,“我们相信,在发起攻击的人类被纳入决策环路之前,我们就已经发现并遏制了攻击。半山《论经书诗》笔势开张、气象疏放,尽抒旷达襟怀;《观海童诗》历经千年风雨,字迹虽渐漫漶,却更添古拙悠远。崖壁“欲界清都”四字,道尽云峰神韵:非仙山缥缈,自有清气萦绕;非都会繁华,自藏千古文心。石壁苔斑水痕交错,风雨雕琢的每一缕纹路,都是岁月沉淀的印记,藏尽千年山间风月。    少时便登至云峰极顶。这也是我们能够更轻松赢得这场网络安全战役的原因之一。”          他进一步指出,“这证明了在AI智能体时代,速度将是网络安全防御的关键。山顶小亭玲珑雅致,占地虽小,却可极目千里、尽揽山河。”          Hugging Face表示,攻击者通过其数据处理管道进入系统——这是AI平台中“暴露面尤为突出”的一个环节。登顶伫立,迎风而立,忽见峰巅五星红旗烈烈舒展、迎风招展。我欣然驻足,与鲜红国旗合影留念。

o | 静静凝望那一抹赤诚中国红,在青山云海间高高飘扬,山河静好、国泰民安的暖意涌上心头,祖国在我心中的滚烫情愫油然而生。攻击者随后在云端建立了一系列临时沙盒环境,在其中执行攻击计划。         目前,Hugging Face仍在评估攻击的完整影响范围。已知攻击者访问了有限的内部数据集和凭证,但尚未发现公开的用户可见模型遭到篡改。         护栏之争:安全还是绊脚石?          这一事件迅速成为美国AI政策辩论的新燃点。山河万里,文脉绵长,家国安宁,眼前一山一石、一风一景,皆是盛世烟火、华夏风华。    【云峰山摩崖崖壁,巨石嵌碑亭,石壁镌刻千年魏碑墨痕】     凭栏远眺,三峰连绵如笔架横亘天地,高低错落,宛若天然文房雅器。西北望,莱州湾薄雾轻笼,风能电站耸立如林,海面泛着柔光,三山岛青影一线,海天一色,苍茫辽阔。         前特朗普政府AI与加密事务主管David Sacks在X上转发了这一事件,并写道:“没有理由在中国模型能够轻松处理的任务上限制美国模型。此刻方才深谙郑道昭当年心境:刺史登临,观山海苍茫,抒胸中风月,落笔不为一己抒怀,而是将山河气度、文人风骨、时代风华,尽数镌入山石,留传千秋。    我静坐亭中,无风物相伴,无俗事缠身,只与青山、古碑、清风默然相对。山风来去悠然,拂动衣襟,抚平心绪。

p | 我们只是在让自己变得更没有竞争力。”他还专门针对Hugging Face事件表示:“护栏实际上损害了防御性安全。

q | 山下炊烟袅袅、村舍安然,几声远犬轻吠,温柔绵长,尽是人间安稳。”          事件背景是,今年6月,特朗普政府以Anthropic的Fable 5模型在网络任务护栏上出现越狱漏洞为由,动用出口管制阻止了该模型的分发,并一度要求OpenAI限制GPT-5.6 Sol的发布,直至OpenAI能够提供充分的护栏保证。郑道昭诗中青烟古寺、白云堂舍早已湮于岁月,唯独石刻长存、文脉不息。繁华终会消散,风骨永远留存,一山文字,便是一山魂魄。    日影当空,徐徐下山。

r | 石阶树影绵长交错,石刻沐斜阳光晕,温润灵动,似千年古石自在呼吸。         与此同时,批评者的声音也不小。再度途经郑道昭造像,依旧安然端坐、从容淡然。         安全工程师Niels Provos直接说:“这不应该发生。我希望前沿实验室在教模型编写安全基础设施上,能花和教它们利用漏洞同样多的时间。”          安全顾问Davi Ottenheimer则更为犀利:“'高度隔离'和'从我们留下的那个唯一漏洞逃脱',这两件事不可能同时为真。”          OpenAI的回应与后续措施          OpenAI在与Hugging Face联合发布的声明中表示,正在采取一系列补救措施:          在漏洞修复期间,对基础设施配置实施严格管控,代价是研究速度放缓;与Hugging Face联合开展取证调查;已向相关第三方软件供应商负责任地披露了被利用的零日漏洞;将Hugging Face纳入“可信访问计划”,支持其利用OpenAI模型能力强化防御。         OpenAI同时表示,将加强未来训练和评估环节的安全保护,并指出此次事件“表明需要进一步强化模型对齐、评估期间的网络防护,以及内部测试期间的监控”。

s | 跨越一千五百载光阴,他静守一山文脉,岁岁候风、年年待客,不语深情,静待每一位慕名而来的访山、读碑、寻韵之人。

t |          Hugging Face CEO Delangue在联合声明中表示:“这一事件可能是同类事件中的首例,它证明了我们长期以来的一个判断:AI安全不会由任何一家公司在封闭中解决,它将在开放环境中、通过协作、让每一位防御者都能广泛获取AI的方式来解决。    【山脚庭院郑道昭造像安然端坐,静候八方访碑游人】     出山门回望,云峰轻雾再起,半隐青山,朦胧如古卷丹青。莱州人所言“登云峰,赏魏碑”,从来不止一句旅游说辞。

u | 山虽不高,承载千年文脉;碑虽无言,沉淀万古风华。人行山中,俯仰之间,沾染笔墨清气,胸藏山河风雅。    附:登云峰山盛景,观郑道昭书法     三峰横卧接苍穹,     北魏风烟入石中。    笔架云横千载墨,     天门外豁一襟雄。    圆融篆隶开新境,     跌宕龙蛇化古松。    欲界清都何处是,     海天回望日当空。

v |     ( 2026.08.22.于烟台凤凰山庄)          感谢您在百忙中阅读这么多文字,特链接两组图片供您欣赏,请点击如下链接:     船歌主题人像摄影作品:芦荻秋深(出镜:小莲)     船歌主题人像摄影作品《桃花依旧》高清组图     (完)          敬请关注往期文章,可点击以下链接:     【浮生琐记】程秉铎 || 戚继光故居游览散记     【浮生琐记】程秉铎 || 被海风灌醉的三天     【浮生琐记】程秉铎 || 港城凤凰山下的秋意与归处返回,查看更多。

w |

Current article:http://5snbknq.sunaichitikouchua.bond/v1e/20260826/52306.html

Published on:00:34:24


顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------