home.social

#quantmcp — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #quantmcp, aggregated by home.social.

fetched live
  1. Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

    Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных схемах MCP-серверов. Главный инсайт: популярные бенчмарки вроде BFCL систематически врут - корреляция их оценок с реальным падением качества оказалась отрицательной (-0.755). На живых схемах модели ведут себя иначе: Llama-3.2-1B начинает возвращать саму JSON-схему вместо вызова или галлюцинирует имена инструментов, а Qwen3-0.6B выдумывает несуществующие таблицы в SQLite. Также показал, что сложность схемы не гарантирует большую деградацию, а выбор кванта «по таблицам» может привести к обратному эффекту.

    habr.com/ru/articles/1057150/

    #квантование #functioncalling #MCP #LLM #бенчмарк #QuantMCP #деградация #галлюцинации #JSONсхема #MCPсерверы

  2. Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

    Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных схемах MCP-серверов. Главный инсайт: популярные бенчмарки вроде BFCL систематически врут - корреляция их оценок с реальным падением качества оказалась отрицательной (-0.755). На живых схемах модели ведут себя иначе: Llama-3.2-1B начинает возвращать саму JSON-схему вместо вызова или галлюцинирует имена инструментов, а Qwen3-0.6B выдумывает несуществующие таблицы в SQLite. Также показал, что сложность схемы не гарантирует большую деградацию, а выбор кванта «по таблицам» может привести к обратному эффекту.

    habr.com/ru/articles/1057150/

    #квантование #functioncalling #MCP #LLM #бенчмарк #QuantMCP #деградация #галлюцинации #JSONсхема #MCPсерверы

  3. Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах

    Как на самом деле квантование ломает вызов инструментов? Собрал бенчмарк QuantMCP, протестировав модели на 4 ГБ VRAM не на синтетике, а на реальных схемах MCP-серверов. Главный инсайт: популярные бенчмарки вроде BFCL систематически врут - корреляция их оценок с реальным падением качества оказалась отрицательной (-0.755). На живых схемах модели ведут себя иначе: Llama-3.2-1B начинает возвращать саму JSON-схему вместо вызова или галлюцинирует имена инструментов, а Qwen3-0.6B выдумывает несуществующие таблицы в SQLite. Также показал, что сложность схемы не гарантирует большую деградацию, а выбор кванта «по таблицам» может привести к обратному эффекту.

    habr.com/ru/articles/1057150/

    #квантование #functioncalling #MCP #LLM #бенчмарк #QuantMCP #деградация #галлюцинации #JSONсхема #MCPсерверы