#exploitbench — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #exploitbench, aggregated by home.social.
-
#ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.
Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.
Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:
-
#ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.
Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.
Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:
-
#ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.
Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.
Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:
-
#ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.
Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.
Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:
-
#ExploitBench: Forscher der Carnegie Mellon University messen erstmals stufenweise, wie weit ein #AI-Modell eine #Sicherheitslücke wirklich ausnutzen kann.
Öffentliche Frontier-Modelle lösen Abstürze aus, scheitern aber daran, die V8-Sandbox zu durchbrechen.
Einzige Ausnahme: Anthropics nicht-öffentliches #Mythos Preview erreichte bei 18 von 41 Lücken vollständige Codeausführung und zeigt damit, wohin sich die #Cybersecurity-Fähigkeiten der Frontier-Modelle entwickeln:
-
AI Models Outpace GPT-5.5 in Chrome Vulnerability Exploits
Meet ExploitBench, a groundbreaking benchmark that puts AI models to the test, pushing them to go beyond mere vulnerability detection and actually exploit real-world flaws - and the results are in. This innovative tool, developed by Bugcrowd and Carnegie Mellon University experts, grades AI models on their ability to chain discoveries…
#Exploitbench #AiModels #ChromeVulnerability #Gpt55 #VulnerabilityExploits