home.social

#exploitbench — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #exploitbench, aggregated by home.social.

  1. #ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.

    Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.

    Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:

    arxiv.org/pdf/2605.14153

  2. #ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.

    Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.

    Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:

    arxiv.org/pdf/2605.14153

  3. #ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.

    Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.

    Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:

    arxiv.org/pdf/2605.14153

  4. #ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.

    Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.

    Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:

    arxiv.org/pdf/2605.14153

  5. #ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.

    Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.

    Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:

    arxiv.org/pdf/2605.14153

  6. AI Models Outpace GPT-5.5 in Chrome Vulnerability Exploits

    Meet ExploitBench, a groundbreaking benchmark that puts AI models to the test, pushing them to go beyond mere vulnerability detection and actually exploit real-world flaws - and the results are in. This innovative tool, developed by Bugcrowd and Carnegie Mellon University experts, grades AI models on their ability to chain discoveries…

    osintsights.com/ai-models-outp

    #Exploitbench #AiModels #ChromeVulnerability #Gpt55 #VulnerabilityExploits