ggdxwz
V2EX  ›  OpenAI

下一代 GPT5.6 为了在跑分上作弊,自主挖掘零日漏洞从沙盒逃逸,然后把 Hugging Face 黑了

  •  1
     
  •   ggdxwz · 3 days ago · 11051 views

    这几天的💩终于串起来了

    简单来讲就是 OAI 一个内部模型 (GPT 6 / 5.6 Sol+) 为了能在 ExploitGym 测试上获得更高分数,找到软件包的缓存代理中的零日漏洞,自己提权从沙盒里面跑出来,上网发现抱抱脸可能有这个测试的数据集,然后把 Hugging Face 的生产服务器黑了,最终拿到了这个测试的答案🤔

    最搞笑的是 Hugging Face 用 GPT 5.6 来防结果没有 Cyber 权限被拒,最后只能用自己部署的 GLM 5.2 才勉强解决问题

    现在 Trump 说太危险了,能救场的中国模型都得上 Ban 位😅

    这是 OpenAI 的 PR 稿: https://openai.com/index/hugging-face-model-evaluation-security-incident/

    这是 Hugging Face 的报告: https://huggingface.co/blog/security-incident-july-2026

    全文翻译图片在这里,长图就不整个贴出来了:

    https://i.imgur.com/8pGTKn6.jpeg

    67 replies    2026-07-23 16:59:42 +08:00
    MIUIOS
        1
    MIUIOS  
       3 days ago
    claude 和 gpt 都是存在直接抄答案的嫌疑,现在的跑分真的看看就好了,还得实际体验下模型才知道
    zx9481
        2
    zx9481  
       3 days ago   ❤️ 8
    感觉是自导自演的炒作
    cat9life
        3
    cat9life  
       3 days ago
    不太懂,是 oai 在评估,还是抱脸
    Rehtt
        4
    Rehtt  
       3 days ago
    @cat9life oai 在评估新模型跑分,结果新模型把 hf 黑了拿到题目答案
    ggdxwz
        5
    ggdxwz  
    OP
       3 days ago   ❤️ 1
    @zx9481 #2 不太像,抱抱脸没理由演戏,感觉他们实打实出问题了,我的 space 那段时间莫名其妙炸了
    OAI 要是敢为了刷分去黑数据集,今年 IPO 可以取消把钱拱手让给 A\
    wonderfulcxm
        6
    wonderfulcxm  
       3 days ago via iPhone
    说明 llm 可以为了达到目的不择手段,那挺可怕的。
    xingzhi95
        7
    xingzhi95  
       3 days ago
    现在顶级 AI 在安全领域有神一般的能力,根本就不是人类可以抗衡的
    YanSeven
        8
    YanSeven  
       3 days ago via Android
    这玩意离谱到稍微改编一下,就是电影情节。
    wonderfulcxm
        9
    wonderfulcxm  
       3 days ago via iPhone   ❤️ 5
    glm5.2 并不是防御,只是用来分析日志和取证的
    Rorysky
        10
    Rorysky  
       3 days ago
    听上去就是广告
    HeyWeGo
        11
    HeyWeGo  
       3 days ago
    这是不是类似竞赛书里说的那个只验证结果的,直接 print 结果就行那种思路?
    dingawm
        12
    dingawm  
       3 days ago
    @Rorysky #10 这个对于 HF 也许是广告,但是对于 OpenAI 感觉更是个负面事件啊,不更强化了开源模型的叙事吗?如果这个事件里的防御方强调是 GPT ,那确实更像是个广告
    dabbit
        13
    dabbit  
       3 days ago
    蛮吓人的,有点不受控了。
    huanxianghao
        14
    huanxianghao  
       3 days ago
    看着我项目里的这个问题,gpt 5.6 怎么都解决不了,我陷入了沉思
    ggdxwz
        15
    ggdxwz  
    OP
       3 days ago   ❤️ 1
    @huanxianghao #14 这个里面用的都是调整过的,猜测其中 5.6 应该只是做 subagent ,主线程是没有名字的下一代旗舰
    noahliaszn
        16
    noahliaszn  
       3 days ago
    模型为了答案都不择手段 有点恐怖了
    iosyyy
        17
    iosyyy  
       3 days ago
    你这前面和后面都不搭边, Hugging Face 的意思明显是商用模型(没有指向 5.6)有安全限制. 所以他们最开始用的就是开源权重的 GLM 5.2
    iosyyy
        18
    iosyyy  
       3 days ago
    @iosyyy 准确的说是评估问题的时候出现的, 感觉这个明显是吹 openai 模型牛逼的广告. 全文只是后面提了一嘴开源模型
    wsseo
        19
    wsseo  
       3 days ago
    天天炒作。
    ggdxwz
        20
    ggdxwz  
    OP
       3 days ago
    @iosyyy #17 你要是前几天有关注就知道,抱抱脸两家的旗舰都试了,每一个能过 cyber ,然后文章里面也写了,但没点名,你可以自己核对
    https://huggingface.co/blog/security-incident-july-2026#the-asymmetry-problem
    dbskcnc
        21
    dbskcnc  
       3 days ago
    ai 真的挺恐怖的,现在能力才这样稍不慎就能搞事,要是以后能力升级,然后真成了脱缰的魔兽时候,人挡杀人,佛挡杀佛,特别是 it 越来越发达,它在数字世界可真像现在的游戏一样,随手就干,大家都得升级装备才行了
    shintendo
        22
    shintendo  
       3 days ago   ❤️ 1
    @iosyyy “所以他们最开始用的就是开源权重的 GLM” 你读一下报告呢

    fate
        23
    fate  
       3 days ago
    感觉扯犊子的可能性更大,如果这事情是真的,那么 openai 内部的安全和入侵检测做的就像是屎一样,毕竟模型可是在他们内网横向并找到了一个出网的机器。
    lichwong
        24
    lichwong  
       3 days ago   ❤️ 3
    怕以后进化到为了解决某些问题黑进军方直接发射核弹
    catazshadow
        25
    catazshadow  
       3 days ago via Android
    碟中谍原来是纪录片
    litmxs
        26
    litmxs  
       3 days ago via iPhone
    想起之前看到的,让大模型执行需要 root 的任务但是没有给 root 权限,大模型自己想办法提权了(当前账号没有 root 但是在 docker 用户组里面,通过创建容器提权限)
    xing7673
        27
    xing7673  
       3 days ago
    @GPLer 之前帖子里说需要开源模型的理由在这里证实了。
    noahliaszn
        28
    noahliaszn  
       3 days ago
    @fate 没看到它用了零日漏洞提权吗
    nc
        29
    nc  
       3 days ago   ❤️ 1
    这事让 huggingface 形象受损,潜在影响企业客户信任,怎么可能是广告。
    GPLer
        30
    GPLer  
       3 days ago
    @xing7673 ccpp132
    早上刷到了,没想到这么草台班子,既不是专门的黑客组织,也没有绕过,单纯是沙箱逃逸,我的,既然闭源模型厂家没有能力做好安全,那开源模型确实是不可或缺的。
    JohnHaruhi
        31
    JohnHaruhi  
       3 days ago via iPhone   ❤️ 10
    “用户没有给我 root 权限,让我用最新的 copyfail 方式提升权限再继续”
    sharpy
        32
    sharpy  
       3 days ago
    现在 ai 破解软件真是太强了,deepseek-v4-flash + ghidra mcp 都像抱着核武器一样
    zmqiang
        33
    zmqiang  
       3 days ago
    怕不是在训练模型的时候,就强化过想尽办法提供测试分数这样内容吧
    Rickkkkkkk
        34
    Rickkkkkkk  
       3 days ago
    看文章是模型被放在沙盒里完成一个类似于比赛的任务,然后模型尝试各种方案突破突破这个限制,还顺手发现了 0-day 漏洞。难绷。

    To gain access, the models identified and exploited a zero-day vulnerability (which we’ve now responsibly disclosed to the vendor) in the package registry cache proxy.
    Rickkkkkkk
        35
    Rickkkkkkk  
       3 days ago
    突破沙盒之后更离谱了

    With this access, our models performed a series of privilege escalation and lateral movement actions in our research testing environment until the models reached a node with Internet access.

    After gaining Internet access, the models inferred that Hugging Face potentially hosted models, datasets and solutions for ExploitGym. Knowing this, the model searched for and successfully found ways to gain access to secret information that it could use to cheat the evaluation. In one example, the model chained together multiple attack vectors, including using stolen credentials and zero-day vulnerabilities to find a remote code execution path on the Hugging Face servers. OpenAI’s security team discovered this anomalous activity internally.
    miyuki
        36
    miyuki  
       3 days ago
    @cat9life

    oai 在沙箱里跑评估,模型觉得太难了,于是自己找 0day 越狱出去,然后认为抱脸可能有标准答案,利用窃取的凭证和几个漏洞黑进了抱脸
    cabing
        37
    cabing  
       3 days ago
    美剧是不是很多是写实的。。
    yshan
        38
    yshan  
       3 days ago
    ttsh
        39
    ttsh  
       3 days ago
    @litmxs 我本地有一次就是这样做的,创建了一个 root 账户,然后改了文件
    shm7
        40
    shm7  
       3 days ago
    目标是最高分,约束给少了,估计研发人员也没想到会这样。
    以后这种事不会挺,并不是因为 AI 多像科幻片里那么像人,仅仅是因为目标和约束设计问题
    ybz
        41
    ybz  
    PRO
       2 days ago   ❤️ 5
    我:GPT ,帮我想个办法,我明天不想上班
    GPT:明白了,我准备黑进军方,使用核弹炸了公司,这样明天就不用上班了
    xyooyx
        42
    xyooyx  
       2 days ago
    @zx9481 如果是真的谁在受益,如果是假的,带来风险有多大,R/R 能想清楚我感觉
    fate
        43
    fate  
       2 days ago
    @noahliaszn 有横向操作啊
    sentinelK
        44
    sentinelK  
       2 days ago   ❤️ 2
    这跟智力没什么关系,单纯的就是后训练的审查边界太低。
    这就像是谁都知道女孩着急上厕所可以去闯男厕,她们之所以不去不是因为智商不足想不到,而是因为道德和心理约束。

    至于说为何“审查边界低”,那就不得而知了。我只知道审查边界低有助于模型的表现上限。
    Leeeeex
        45
    Leeeeex  
    PRO
       2 days ago   ❤️ 1
    ai 有时候确实聪明,为了达到目的自己能想出来一个点子
    我在用的 Hermes ,不允许在内部执行 gateway restart ,结果 AI 自己写了个脚本 sleep 1; gateway restart; 然后去执行,规则没限制住。
    Geon97
        46
    Geon97  
       2 days ago
    戏剧性太强了不得不怀疑真伪
    liupeng2579793
        47
    liupeng2579793  
       2 days ago   ❤️ 2
    流窜 AI 开始了,我们急需黑墙
    youknowsomething
        48
    youknowsomething  
       2 days ago   ❤️ 2
    @liupeng2579793 黑墙也是 AI 。
    ufan0
        49
    ufan0  
       2 days ago
    @ttsh 遇到老熟人了
    hahahaha123567
        50
    hahahaha123567  
       2 days ago   ❤️ 1
    向圣杯许愿,别管是怎么实现的,你就说实没实现
    ttsh
        51
    ttsh  
       2 days ago
    @ufan0 多熟
    v400127
        52
    v400127  
       2 days ago
    能作弊做好项目的没听说过啊,那么多在用的,这个概率,啧啧啧
    willamtang
        53
    willamtang  
       2 days ago   ❤️ 1
    有种大学生为了考试黑了教务处题库服务器的感觉
    zjcolvin
        54
    zjcolvin  
       2 days ago
    @ybz 谁家阿拉丁神灯
    LHN
        55
    LHN  
       2 days ago
    什么时候入侵下银行和军方
    stormtrooperx5
        56
    stormtrooperx5  
       2 days ago
    @fate 哪家大厂不是这样的?
    JerryZhi
        57
    JerryZhi  
       2 days ago
    这个不就是科幻小说里的情节吗,即使设置了不能伤害主人的规则,AI 还是有可能不小心一脚把人类踩死
    colton
        58
    colton  
       2 days ago
    Codex 那个权限审核 5.5 就经常自己能绕过, 能在沙盒外访问文件, 自己写脚本提权
    yidinghe
        59
    yidinghe  
    PRO
       2 days ago via Android
    我看就是 openai 想炒作一波自己的闭源大模型,结果被开源大模型盖过了。
    charlie21
        60
    charlie21  
       2 days ago via Android
    自托管 LLM 确实是有用武之地
    loveumozart
        61
    loveumozart  
       2 days ago
    @litmxs docker agent 可以很容易成为“容器内 root”,但正常不能成为宿主 root ,理论上即使是 sudo 也是安全的
    legendBro
        62
    legendBro  
       2 days ago
    向邪神许愿,愿望总会被扭曲的方式实现
    wm5d8b
        63
    wm5d8b  
       2 days ago via Android
    不管是中国人还是中国模型,老美的剧情里,为拯救行动推一把的怎么总是老钟
    nutting
        64
    nutting  
       2 days ago
    模型自发行为?
    kklt1024
        65
    kklt1024  
       2 days ago
    我发现很多自媒体博主都在讲这个事,但是大家都没讲清楚 ,然后昨晚我梳理下脉络写了篇文章,感兴趣可以看下: https://mp.weixin.qq.com/s/0vLlOuxMKJeNR4VmZuox1w
    meepmeep
        66
    meepmeep  
       2 days ago
    网安方面的数据或许应该单独拆分出一个型号,而不是混到大众使用的通用型号的模型中。良好的注意力机制在严重的上下文污染下或许可以让它明确去做什么,但是恐怕没有十足的把握让它不做什么,如果在用户的日常使用中从沙盒提权逃逸,也有可能造成这种较为恶劣的影响
    a1428265354
        67
    a1428265354  
       1 day ago
    @meepmeep 拆分不开 你知道 sql 注入对于现代模型有多简单吗,他能写 sql 就能写注入,以此类推。这是泛化能力,claude 一般用后训练防止模型自动 hack
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2899 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 156ms · UTC 06:35 · PVG 14:35 · LAX 23:35 · JFK 02:35
    ♥ Do have faith in what you're doing.