#servingsystems — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #servingsystems, aggregated by home.social.
-
RT @rohanpaul_ai: Eine neue Paper von Alibaba und ByteDance zeigt, dass AI-Agenten nicht mehr wie herkömmliche LLM-Anfragen bedient werden können. Denn die meisten Leistungsprobleme liegen heute in der Interaktion zwischen Tools, Speicher, Umgebungen und dem Modell. Der Engpass kann sich mit veränderten Anfragen und Bereitstellungen vom LLM auf Embeddings, Datenbanken, Sandboxes oder Netzwerkübertragungen verschieben. Das Paper baut AgentSysBench auf Basis von 10 agentic Anwendungen auf und stellt fest, dass die Modell-Inferenz oft nicht mehr der Hauptengpass ist. Sie finden, dass aufgabenbewusstes Serving die Latenz um 29–40% reduziert, kommunikationsbewusste Platzierung bis zu eine 4.5× Beschleunigung liefert, State-Offloading den Speicher um 4.6× reduziert und Caching 35.2% redundanter Suchaufrufe entfernt. Also reicht die Optimierung von Tokens pro Sekunde nicht mehr aus. Die Agent-Infrastruktur muss Modelle, Tools, Speicher und Kommunikation als eine einzige Workload planen. – arxiv.org/abs/2608.15127 Titel: "From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems
mehr auf Arint.info
#AgentSysBench #AI #Alibaba #ByteDance #LLM #ServingSystems #arint_info