home.social

#llama-cpp — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #llama-cpp, aggregated by home.social.

fetched live
  1. Cómo ejecutar una inteligencia artificial en local sin tarjeta gráfica dedicada: instalación y configuración de LM Studio


    Cuando hablamos de inteligencia artificial generativa solemos pensar en servicios como ChatGPT, Gemini o Claude. Estas plataformas ejecutan sus modelos en grandes centros de datos y requieren conexión a Internet. Sin embargo, también es posible instalar un modelo de lenguaje en nuestro propio ordenador y utilizarlo mediante una interfaz de conversación similar a ChatGPT.

    Para hacerlo no es imprescindible disponer de una tarjeta gráfica dedicada. Una GPU moderna acelera considerablemente la generación de texto, pero un ordenador equipado con un procesador relativamente potente y suficiente memoria RAM también puede ejecutar modelos de inteligencia artificial localmente.

    En este artículo veremos cómo instalar y configurar LM Studio en Windows 11, utilizando como ejemplo un equipo basado en un procesador Intel Xeon E5-2680 v4, 64 GB de memoria DDR4 ECC y una unidad NVMe. El procedimiento también es aplicable a otros ordenadores con características parecidas.

    ¿Qué significa ejecutar un modelo de IA localmente?

    Un modelo de lenguaje local se descarga y ejecuta directamente en nuestro ordenador. Las preguntas, documentos y respuestas se procesan utilizando la CPU, la memoria RAM y, si está disponible, la tarjeta gráfica del propio equipo.

    Después de descargar el programa y el modelo, no es necesario mantener una conexión permanente a Internet. LM Studio indica que las conversaciones, el procesamiento de documentos y la ejecución de su servidor local pueden funcionar completamente sin conexión. Según su documentación, lo introducido en los chats con modelos locales no abandona el dispositivo.

    Esto proporciona varias ventajas:

    • Mayor privacidad.
    • Funcionamiento sin conexión a Internet.
    • Ausencia de cuotas por número de consultas.
    • Posibilidad de experimentar con numerosos modelos.
    • Control sobre el modelo, su configuración y sus archivos.
    • Integración con aplicaciones y programas propios.
    • Aprovechamiento de ordenadores que todavía disponen de una buena CPU y abundante memoria RAM.

    Sin embargo, también existen limitaciones:

    • Los modelos locales suelen tener menos capacidad que los servicios comerciales más avanzados.
    • La generación de texto puede ser lenta si no se dispone de GPU.
    • Los modelos ocupan varios gigabytes.
    • No tienen acceso automático a Internet.
    • Pueden proporcionar respuestas incorrectas o inventadas.
    • La privacidad técnica no sustituye las condiciones legales o editoriales aplicables a documentos confidenciales.

    Por tanto, un modelo local debe entenderse como una herramienta auxiliar. Sus respuestas siempre tienen que ser verificadas por una persona, especialmente en tareas científicas, técnicas, médicas o jurídicas.

    El ordenador utilizado en esta prueba

    El equipo empleado como referencia tiene las siguientes características:

    • Placa base HUANANZHI X99 QD4.
    • Procesador Intel Xeon E5-2680 v4.
    • 64 GB de memoria DDR4 ECC registrada a 2133 MHz.
    • Cuatro módulos de 16 GB.
    • Unidad de almacenamiento NVMe.
    • Windows 11.
    • Sin tarjeta gráfica dedicada para inteligencia artificial.

    El Xeon E5-2680 v4 es un procesador Broadwell de 2016 que dispone de 14 núcleos, 28 hilos, 35 MB de memoria caché y una frecuencia turbo máxima de 3,3 GHz. También admite instrucciones AVX2 y cuatro canales de memoria.

    Las instrucciones AVX2 son importantes porque LM Studio las necesita para funcionar en ordenadores Windows con procesadores x64. La documentación oficial recomienda al menos 16 GB de RAM y una GPU con 4 GB de memoria, aunque esta última es una recomendación y no un requisito absoluto.

    La información completa del procesador puede consultarse en la página oficial de Intel.

    La importancia de la memoria RAM

    Cuando no existe una tarjeta gráfica dedicada, el modelo se carga principalmente en la memoria RAM y se ejecuta mediante la CPU. Por este motivo, disponer de 32 o 64 GB de memoria puede ser más importante que tener un número muy elevado de núcleos.

    En este equipo se utilizan cuatro módulos de memoria. Si la placa los configura correctamente, el procesador puede acceder a ellos mediante cuatro canales. Esto aumenta el ancho de banda disponible, un aspecto especialmente importante durante la generación de texto.

    Se puede comprobar la configuración con una herramienta como CPU-Z. En la pestaña Memory, el apartado correspondiente a los canales debería indicar Quad. Si aparece Dual, conviene revisar la colocación de los módulos y el manual de la placa base.

    El NVMe reduce el tiempo necesario para cargar los archivos, pero una vez que el modelo se encuentra en la RAM, la velocidad depende fundamentalmente del procesador y del ancho de banda de la memoria.

    ¿Qué es LM Studio?

    LM Studio es una aplicación de escritorio que permite buscar, descargar, administrar y ejecutar modelos de lenguaje en Windows, Linux y macOS. Su interfaz de conversación es parecida a la de ChatGPT: el usuario escribe una pregunta y el modelo genera una respuesta manteniendo el contexto del diálogo.

    Entre sus principales funciones se encuentran:

    • Descargar modelos compatibles desde Hugging Face.
    • Ejecutar modelos localmente utilizando llama.cpp.
    • Mantener diferentes conversaciones.
    • Organizar los chats mediante carpetas.
    • Comparar conversaciones o modelos utilizando una vista dividida.
    • Adjuntar documentos PDF, DOCX y TXT.
    • Configurar el contexto, la temperatura y otros parámetros.
    • Crear un servidor local compatible con la API de OpenAI.
    • Utilizar los modelos descargados sin conexión a Internet.

    Las conversaciones se guardan localmente. En Windows suelen encontrarse en:

     %USERPROFILE%\.lmstudio\conversations  

    LM Studio explica que el modelo no aprende permanentemente de nuestros chats. Solamente puede utilizar la información que se encuentre disponible en el contexto de la conversación o en las instrucciones proporcionadas durante la sesión.

    La aplicación puede descargarse desde su página oficial, mientras que su funcionamiento y configuración se explican en la documentación de LM Studio.

    La presencia de una sección de precios en la página de LM Studio puede producir cierta confusión. Sin embargo, la instalación de la aplicación y la ejecución de modelos en nuestro propio ordenador están incluidas en su modalidad gratuita. El plan Free, cuyo precio es de cero dólares, permite:

    ¿LM Studio es gratuito?

    • Ejecutar modelos locales en el ordenador.
    • Utilizar los motores llama.cpp y MLX.
    • Conversar mediante la interfaz de LM Studio.
    • Utilizar el agente Bionic con las limitaciones del plan gratuito.
    • Realizar transcripción de voz local.
    • Utilizar LM Link hasta en cinco dispositivos.
    • Acceder de manera limitada a algunas funciones de búsqueda web.

    Por tanto, no es necesario contratar una suscripción para instalar LM Studio, descargar un modelo compatible y ejecutarlo mediante la CPU, la memoria RAM o una GPU propia.

    Una vez descargado el modelo, la generación local no se factura por consultas, minutos ni tokens. Podemos mantener conversaciones tan largas o numerosas como permita nuestro hardware, sin necesidad de adquirir créditos.

    ¿Por qué aparecen planes de pago?

    LM Studio ha incorporado Bionic, una modalidad que combina la inteligencia artificial local con servicios opcionales ejecutados en la nube. Los planes ofrecidos actualmente son:

    PlanPrecio indicadoCaracterísticas principalesFree0 dólaresModelos locales y funciones básicasBionic+20 dólares al mesModelos abiertos alojados en servidores, búsqueda web y extracción de páginasPro100 dólares al mesLímites de uso superiores y acceso anticipado a determinadas funciones

    Los planes Bionic+ y Pro están destinados principalmente a quienes desean utilizar modelos más grandes ejecutados en servidores externos, realizar más búsquedas web o disponer de mayores límites de uso.

    Estos servicios son opcionales. No es necesario contratarlos para seguir utilizando modelos locales mediante LM Studio. La diferencia fundamental es la siguiente:

    Ejecución localEjecución mediante BionicUtiliza nuestra CPU, RAM o GPUUtiliza servidores externosNo se paga por tokenPuede estar sujeta a cuotas, límites o créditosPuede funcionar sin InternetNecesita conexiónLos datos permanecen en el ordenadorLas consultas se procesan externamenteEl rendimiento depende de nuestro equipoPermite acceder a modelos más exigentesConsume electricidad localmenteEl procesamiento lo realiza el proveedor

    La información actualizada sobre estos planes puede consultarse en la página oficial de precios de LM Studio.

    ¿Los modelos descargados también son gratuitos?

    LM Studio es la aplicación utilizada para ejecutar los modelos, pero no es necesariamente el creador ni el propietario de ellos. La mayoría de los modelos disponibles en su buscador proceden de Hugging Face y han sido publicados por organizaciones o desarrolladores externos.

    Entre los modelos abiertos que habitualmente pueden descargarse y ejecutarse localmente encontramos familias como:

    • Qwen.
    • Llama.
    • Mistral.
    • Gemma.
    • DeepSeek.
    • gpt-oss.
    • Phi.

    En la mayoría de los casos, descargar sus pesos y utilizarlos localmente no requiere realizar ningún pago. Sin embargo, cada modelo se distribuye bajo su propia licencia. Por este motivo, antes de utilizarlo debemos comprobar:

    • Si permite uso personal.
    • Si admite utilización académica.
    • Si puede emplearse comercialmente.
    • Si exige algún tipo de atribución.
    • Si impone restricciones sobre determinados usos.
    • Si requiere aceptar previamente una licencia.
    • Si la cuantización descargada procede de una fuente fiable.

    Los términos «modelo abierto», «pesos abiertos» y «software libre» no significan exactamente lo mismo. Un modelo puede permitir descargar sus pesos sin que todos sus componentes, datos de entrenamiento o licencia sean completamente abiertos.

    Para realizar pruebas personales, traducciones, programación, redacción o investigación propia, generalmente encontraremos numerosos modelos gratuitos. No obstante, si el modelo va a incorporarse a un producto comercial o a ofrecerse como servicio, resulta imprescindible revisar su licencia concreta.

    ¿Puede haber modelos de pago?

    Sí, aunque debemos distinguir diferentes situaciones. Un modelo puede utilizarse mediante:

    • Descarga gratuita de sus pesos.
    • Acceso condicionado al registro y aceptación de una licencia.
    • Una API comercial que cobra por tokens.
    • Un servicio en la nube con suscripción.
    • Un proveedor externo que cobre por alojarlo y ejecutarlo.
    • Una licencia comercial específica.

    En LM Studio podemos encontrar principalmente modelos descargables cuyos archivos se ejecutan localmente. No obstante, Bionic también ofrece acceso a modelos alojados en la nube, cuyo uso puede estar incluido en una suscripción o consumir créditos.

    Por tanto, antes de descargar o utilizar un modelo conviene comprobar si aparece identificado como: Local o como: Cloud. Para mantener el uso completamente gratuito y privado debemos seleccionar un modelo local, descargar sus pesos y ejecutarlo utilizando los recursos de nuestro propio ordenador.

    Costes indirectos de la inteligencia artificial local

    Aunque LM Studio y muchos modelos puedan utilizarse sin pagar una suscripción, la ejecución local no carece completamente de costes. Debemos considerar:

    • El consumo eléctrico del ordenador.
    • El espacio ocupado en el NVMe o SSD.
    • El tiempo necesario para descargar los modelos.
    • La carga prolongada del procesador.
    • La refrigeración y ventilación del equipo.
    • El desgaste derivado de un funcionamiento intensivo.
    • El coste inicial del hardware.

    Un modelo de 8B cuantizado puede ocupar aproximadamente entre 5 y 7 GB, mientras que uno de 32B puede superar los 20 GB. Si descargamos diferentes cuantizaciones y modelos, el espacio utilizado puede crecer rápidamente.

    En el caso del Xeon E5-2680 v4, el procesador tiene un TDP de 120 W. Esto no significa que consuma exactamente 120 W en todo momento, pero durante una generación prolongada puede trabajar con una carga elevada. Es recomendable disponer de una refrigeración adecuada y vigilar las temperaturas.

    A pesar de estos costes indirectos, para un usuario que ya posee el ordenador, ejecutar modelos locales puede resultar económicamente interesante porque no existe una factura asociada al número de consultas.

    Funcionamiento completamente local y sin conexión

    Después de instalar LM Studio y descargar tanto el motor como el modelo, las funciones esenciales pueden utilizarse sin conexión a Internet. Según la documentación oficial, no necesitan conexión:

    • La ejecución de modelos descargados.
    • Las conversaciones locales.
    • El procesamiento local de documentos.
    • La utilización del servidor local.
    • La generación de texto.

    Sí requieren conexión:

    • Buscar modelos en la sección Discover.
    • Descargar nuevos modelos.
    • Descargar o actualizar los motores de ejecución.
    • Buscar actualizaciones de LM Studio.
    • Utilizar funciones de búsqueda web.
    • Acceder a los modelos de Bionic alojados en la nube.

    LM Studio afirma que el contenido introducido al conversar con un modelo local no abandona el dispositivo. Asimismo, los documentos adjuntados para realizar consultas o RAG se procesan localmente.

    Podemos comprobarlo con una prueba sencilla:

    1. Descargar el modelo.
    2. Cargarlo y comprobar que responde.
    3. Cerrar LM Studio.
    4. Desconectar temporalmente el ordenador de Internet.
    5. Volver a abrir la aplicación.
    6. Cargar el mismo modelo.
    7. Mantener una conversación.

    Si el modelo sigue funcionando, estaremos utilizando la inferencia local. Esto no significa que cualquier documento pueda procesarse libremente. Cuando trabajemos con información confidencial, manuscritos no publicados, datos personales o documentación de terceros, también tendremos que respetar las condiciones contractuales, legales, profesionales o editoriales aplicables.

    ¿Es necesario crear una cuenta o contratar un plan?

    Para las funciones locales básicas no debería ser necesario contratar un plan de pago. La descarga de modelos desde Hugging Face puede realizarse directamente desde el buscador de LM Studio, aunque algunos repositorios concretos podrían solicitar una cuenta o la aceptación previa de su licencia. Durante la instalación debemos diferenciar cuidadosamente entre:

    • La aplicación local.
    • El modelo descargado.
    • Los servicios Bionic.
    • Las funciones de búsqueda web.
    • Las API externas.
    • Los complementos o servidores MCP.

    Si nuestro objetivo es obtener la máxima privacidad, podemos limitarnos a la aplicación, el motor llama.cpp y un modelo GGUF local. No será necesario activar servicios externos, búsqueda web ni modelos en la nube.

    En resumen, LM Studio puede instalarse y utilizarse gratuitamente para ejecutar modelos locales. Los precios mostrados en su web corresponden principalmente a servicios adicionales en la nube, mayores límites de uso y otras prestaciones opcionales. Para el ordenador utilizado en este artículo podemos descargar un modelo GGUF gratuito, cargarlo en los 64 GB de RAM y generar texto sin pagar ninguna cuota por consulta.

    Requisitos mínimos

    Antes de instalarlo conviene comprobar los siguientes puntos:

    • Windows 10 u 11 de 64 bits.
    • Procesador compatible con AVX2.
    • Un mínimo recomendable de 16 GB de RAM.
    • Espacio suficiente en el disco.
    • Conexión a Internet para descargar inicialmente la aplicación, el motor y los modelos.

    No todos los procesadores antiguos incluyen AVX2. Puede comprobarse buscando el modelo exacto del procesador en la página del fabricante o utilizando CPU-Z.

    La ausencia de una tarjeta gráfica dedicada no impide usar LM Studio, pero limita el tamaño práctico del modelo y reduce la velocidad.

    Descargar e instalar LM Studio

    El primer paso consiste en acceder a la web oficial: Descargar LM Studio

    Debemos seleccionar la versión para Windows y ejecutar el instalador descargado. Una vez finalizada la instalación, abrimos la aplicación.

    LM Studio puede mostrar diferentes niveles de interfaz. Para acceder a todos los parámetros es recomendable seleccionar el modo Power User. También se puede cambiar el idioma desde:

     Settings → Preferences → Language 

    La aplicación dispone de traducción al español. En Windows, la configuración puede abrirse mediante el atajo Ctrl + ,.

    Descargar el primer modelo

    Dentro de LM Studio encontraremos una sección denominada Discover. Desde ella se pueden buscar y descargar modelos compatibles.

    Como primera prueba para un ordenador sin GPU dedicada podemos buscar:

     Qwen3 8B GGUF 

    Es importante elegir una versión destinada a conversación o instrucciones. Dependiendo del modelo, puede aparecer con términos como:

     Instruct  Chat  GGUF 

    No conviene descargar automáticamente el archivo más grande. Un mismo modelo puede ofrecerse en diferentes cuantizaciones, identificadas mediante nombres como:

     Q3_K_S  Q4_K_M  Q5_K_M  Q6_K  Q8_0 

    ¿Qué significa la cuantización?

    Los modelos utilizan millones o miles de millones de parámetros. La cuantización reduce el número de bits empleados para almacenar esos parámetros, disminuyendo el tamaño del archivo y la memoria necesaria.

    Una cuantización de cuatro bits permite ejecutar modelos relativamente grandes con una pérdida moderada de calidad.

    Para comenzar, la opción más equilibrada suele ser:

     Q4_K_M 

    LM Studio recomienda escoger una cuantización de cuatro bits o superior cuando el ordenador tenga capacidad suficiente.

    A modo orientativo:

    ModeloTamaño aproximado en Q4Uso recomendado3–4B2–4 GBEquipos modestos7–8B5–7 GBPrimera opción sin GPU12–14B9–12 GBMayor calidad, menor velocidad20–24B13–20 GBEquipos con 32–64 GB30–32B20–26 GBPosible con 64 GB, pero lento70B45–55 GBPoco práctico sin GPU

    Estas cifras no incluyen toda la memoria adicional empleada por el contexto, la caché y el propio sistema operativo.

    ¿Qué modelo conviene elegir?

    Para el equipo con Xeon E5-2680 v4 y 64 GB empezaríamos mejor por un modelo de 8B. Una posible secuencia de pruebas sería:

    1. Qwen3 8B en formato GGUF y cuantización Q4_K_M.
    2. Qwen3 14B Q4_K_M.
    3. gpt-oss 20B.
    4. Algún modelo de 30B o 32B, si se acepta una respuesta más lenta.

    Un modelo de 8B es adecuado para:

    • Consultas generales.
    • Traducción.
    • Resumen de textos propios.
    • Corrección de redacción.
    • Explicaciones técnicas.
    • Ayuda con programación.
    • Organización de ideas.
    • Clasificación y extracción de información.

    Los modelos de 14B o 20B pueden mejorar la coherencia y el razonamiento, pero requieren más memoria y tardan más en generar cada respuesta.

    No recomendaríamos comenzar con un modelo de 70B. Aunque una versión muy cuantizada podría llegar a caber en 64 GB, su funcionamiento mediante esta CPU sería demasiado lento para una conversación cómoda.

    Cargar el modelo en memoria

    Una vez descargado, hay que ir a la pestaña Chat y abrir el selector situado en la parte superior. Desde ahí elegiremos el modelo instalado.

    Cargar un modelo significa copiar sus parámetros desde el NVMe hasta la memoria RAM. Este proceso puede tardar varios segundos. Cuando termina, se puede escribir una consulta en la zona inferior de la ventana.

    Como configuración inicial para el Xeon E5-2680 v4 utilizamos:

    • Modelo: Qwen3 8B Instruct.
    • Formato: GGUF.
    • Cuantización: Q4_K_M.
    • Longitud de contexto: 8192 tokens.
    • Hilos de CPU: 14.
    • Capas descargadas en GPU: 0.
    • Temperatura: 0,6 o 0,7.
    • Tamaño máximo de respuesta: entre 1024 y 2048 tokens.

    ¿Cuántos hilos de CPU deben utilizarse?

    El Xeon E5-2680 v4 tiene 14 núcleos físicos y 28 hilos gracias a Hyper-Threading. Utilizar los 28 hilos no garantiza una generación más rápida.

    Como punto de partida configuraremos:

     CPU Threads: 14 

    Después podemos comparar el rendimiento con 12, 16, 20 y 28 hilos. La mejor configuración dependerá del motor utilizado, del modelo y del resto de procesos activos.

    Mientras se genera una respuesta, el Administrador de tareas de Windows permite observar el uso del procesador y de la memoria:

     Ctrl + Mayús + Esc 

    Conviene vigilar también la temperatura. El Xeon E5-2680 v4 tiene un consumo térmico nominal de 120 W, por lo que necesita un disipador adecuado durante cargas prolongadas.

    Configurar la longitud de contexto

    La longitud de contexto determina cuánta información puede mantener el modelo simultáneamente. Incluye:

    • Las instrucciones iniciales.
    • Las preguntas anteriores.
    • Las respuestas generadas.
    • Los documentos añadidos.
    • El nuevo mensaje del usuario.

    El contexto se mide en tokens. Como aproximación, un token representa alrededor de tres cuartas partes de una palabra en inglés, aunque la relación cambia según el idioma. Un contexto mayor permite trabajar con conversaciones o documentos más largos, pero aumenta el consumo de memoria y puede reducir el rendimiento.

    Para empezar resulta prudente utilizar:

     Context Length: 8192 

    Si se necesita procesar un documento más extenso, puede probarse con 16384 o 32768 tokens, siempre que la memoria utilizada siga siendo razonable. No conviene establecer el máximo disponible simplemente porque el modelo lo admita.

    Primera prueba de funcionamiento

    Podemos comenzar con una consulta sencilla:

     Explícame en español qué es una red neuronal artificial y proporciona un ejemplo aplicado a la monitorización de energía eléctrica. 

    Después podemos probar una tarea de redacción:

     Corrige el siguiente párrafo conservando su significado técnico y enumera los cambios realizados. 

    Finalmente, puede solicitarse una respuesta estructurada:

     Compara en una tabla las ventajas y limitaciones de ejecutar un modelo de inteligencia artificial localmente frente a utilizar un servicio en la nube. 

    En la interfaz pueden aparecer estadísticas como:

    • Tiempo hasta el primer token.
    • Tokens generados por segundo.
    • Número total de tokens.
    • Memoria utilizada.

    Estas cifras permiten comparar modelos y configuraciones.

    Rendimiento esperable con el Xeon E5-2680 v4

    Sin una prueba directa no se puede garantizar una velocidad concreta, pero pueden utilizarse los siguientes valores como referencia aproximada:

    Tamaño del modeloVelocidad orientativa7–8B Q46–12 tokens por segundo12–14B Q43–7 tokens por segundo20B Q42–6 tokens por segundo30–32B Q41–3 tokens por segundo70B Q4Menos de 1–1,5 tokens por segundo

    La velocidad real depende de la cuantización, el contexto, la frecuencia efectiva del procesador, los canales de memoria y la versión del motor.

    Un modelo de 8B puede producir texto a una velocidad cómoda. Uno de 32B puede ofrecer respuestas mejores, pero será necesario esperar más.

    Conversaciones y documentos locales

    LM Studio permite crear diferentes conversaciones y organizarlas en carpetas. También ofrece vista dividida para comparar dos chats o modelos.

    Además, se pueden adjuntar archivos .pdf, .docx y .txt. Si el documento cabe dentro del contexto, puede incorporarse completo. Cuando es demasiado largo, LM Studio puede recurrir a un sistema RAG, que localiza y proporciona al modelo los fragmentos más relacionados con la consulta.

    Según LM Studio, este procesamiento se realiza localmente y el documento no abandona la aplicación. Aun así, antes de introducir información reservada deben comprobarse las normas contractuales, profesionales o editoriales aplicables. Que una herramienta funcione sin conexión no significa automáticamente que esté autorizado utilizarla con cualquier documento.

    Cómo comprobar que funciona sin Internet

    Una vez descargados el programa, el motor y el modelo, podemos cerrar LM Studio, desconectar temporalmente la conexión de red y volver a abrirlo. El modelo descargado debe poder cargarse y responder normalmente. Sin conexión no estarán disponibles:

    • La búsqueda de nuevos modelos.
    • La descarga de modelos.
    • La descarga o actualización de motores.
    • Las actualizaciones de LM Studio.
    • Cualquier servicio externo añadido posteriormente.

    Sí seguirán funcionando:

    • Los modelos ya descargados.
    • Las conversaciones locales.
    • Los documentos procesados localmente.
    • El servidor local.
    • La generación de texto.

    Más información en la documentación sobre el funcionamiento sin conexión de LM Studio.

    Privacidad y seguridad

    La privacidad es una de las principales razones para ejecutar modelos en local, pero conviene adoptar algunas precauciones:

    • Descargar LM Studio únicamente desde su página oficial.
    • Elegir modelos procedentes de repositorios conocidos.
    • Revisar la licencia de cada modelo.
    • Mantener Windows y LM Studio actualizados.
    • No activar complementos ni servidores externos innecesarios.
    • Limitar el servidor local a localhost si no debe accederse desde otros ordenadores.
    • Cifrar la unidad cuando se maneje información sensible.
    • No sincronizar automáticamente la carpeta de conversaciones con servicios en la nube.
    • Eliminar los chats y documentos cuando dejen de ser necesarios.
    • Mantener copias de seguridad de la información importante.
    • Verificar siempre las respuestas generadas.

    Los modelos no aprenden de forma permanente a partir de cada conversación. LM Studio aclara que el modelo solo conoce el contenido que se encuentra en el contexto del chat o en las instrucciones proporcionadas durante la sesión.

    Problemas frecuentes

    LM Studio no se instala o no inicia:La causa puede ser un procesador sin AVX2. Hay que comprobar las instrucciones compatibles con la CPU.

    El modelo no puede cargarse:Probablemente no haya suficiente RAM disponible. Podemos cerrar otros programas, reducir el contexto o descargar una cuantización más pequeña.

    El ordenador responde muy lentamente: Conviene probar un modelo con menos parámetros, utilizar Q4_K_M, reducir el contexto y ajustar el número de hilos.

    La memoria se llena: No debemos elegir un modelo cuyo archivo ocupe prácticamente toda la RAM. Windows, la caché del contexto y LM Studio también necesitan memoria.

    El modelo responde en inglés:Podemos escribir una instrucción inicial como:

     Responde siempre en español, salvo que te solicite expresamente otro idioma. 

    LM Studio también permite guardar instrucciones o configuraciones para reutilizarlas.

    Las respuestas son incorrectas: Los modelos de lenguaje pueden inventar datos. Debemos pedir explicaciones verificables, comprobar las referencias y no aceptar automáticamente cifras, nombres o conclusiones.

    El modelo pierde información del comienzo:La conversación probablemente ha superado la longitud de contexto. Se puede iniciar un nuevo chat, resumir la conversación o aumentar moderadamente el contexto.

    LM Studio frente a ChatGPT

    Aunque su aspecto es parecido, no son exactamente equivalentes.

    CaracterísticaLM Studio con modelo localServicio de IA en la nubeProcesamientoEn el ordenadorEn servidores externosInternetNo es necesario tras la descargaNormalmente obligatorioPrivacidadMayor control localDepende del servicioVelocidadDepende del hardwareGeneralmente superiorCalidad máximaLimitada por el modelo elegidoAcceso a modelos avanzadosCoste por consultaNoPuede existir suscripción o límitesInstalaciónNecesariaNo necesariaConsumo eléctricoLo asume el ordenador localLo asume el proveedorActualizaciónManualGestionada por el proveedor

    LM Studio no pretende sustituir en todos los casos a los modelos comerciales. Su interés reside en proporcionar control, privacidad, experimentación y funcionamiento autónomo.

    ¿Merece la pena utilizar IA local sin GPU?

    La respuesta depende del uso previsto. Para traducción, redacción, programación, resumen de documentos propios, clasificación de textos y consultas técnicas, un modelo de 8B o 14B puede resultar muy útil.

    El Xeon E5-2680 v4 no es un procesador reciente, pero sus 14 núcleos, el soporte AVX2, los cuatro canales de memoria y los 64 GB de RAM permiten reutilizarlo como una plataforma razonable para experimentar con inteligencia artificial local.

    La unidad NVMe agiliza la carga y el espacio disponible permite mantener varios modelos instalados. No obstante, para obtener una conversación fluida conviene elegir modelos moderados y cuantizados, en lugar de intentar ejecutar el modelo más grande que pueda caber en memoria.

    Conclusión

    Ejecutar un modelo de inteligencia artificial en local ya no está reservado a grandes servidores equipados con costosas tarjetas gráficas. Un ordenador con Windows 11, procesador compatible con AVX2 y suficiente memoria RAM puede utilizar aplicaciones como LM Studio para descargar y ejecutar modelos abiertos mediante una interfaz similar a ChatGPT.

    En el equipo analizado, formado por una placa HUANANZHI X99 QD4, un Xeon E5-2680 v4, 64 GB de RAM DDR4 ECC y una unidad NVMe, la configuración inicial recomendada es un modelo de aproximadamente 8B parámetros en formato GGUF y cuantización Q4_K_M, con 8192 tokens de contexto y 14 hilos de CPU.

    A partir de esta base se pueden probar modelos de 14B o 20B y comparar la calidad, velocidad y consumo de memoria.

    La IA local no elimina la necesidad de revisar cuidadosamente los resultados, pero ofrece una alternativa interesante para quienes desean experimentar, proteger sus datos y aprovechar ordenadores que todavía cuentan con una buena cantidad de memoria y capacidad de procesamiento.

    #ejecutarIAEnCPU #gptOss #hardwareParaInteligenciaArtificial #HuggingFace #IALocal #intelXeon #inteligenciaArtificialLocal #InteligenciaArtificialOffline #inteligenciaArtificialSinGPU #llamaCpp #LLM #LMStudio #modelosCuantizados #ModelosDeLenguaje #modelosGGUF #privacidadDigital #Q4KM #Qwen #Windows11 #XeonE52680V4
  2. Compare llama-server and Ollama for local LLM hosting in 2026: GGUF management, APIs, GPU control, KV cache, model lifetime, and migration triggers.

    #llamacpp #Ollama #LLM #SelfHosting #Self-Hosting #API

    glukhov.org/llm-hosting/compar

  3. Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

    Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

    habr.com/ru/articles/1080970/

    #локальные_llm #selfhosted #llamacpp #gguf #ram #vcpu #kvcache #квантование #inference #numa

  4. Compare AMD ROCm and Vulkan backends for llama.cpp, Ollama, LM Studio, vLLM and TGI, with build commands, verification checks and a practical 2026 verdict.

    #LLM #SelfHosting #llamacpp #Ollama #vLLM #Docker #Linux

    glukhov.org/llm-hosting/compar

  5. Fit 32K to 128K LLM context into 16 GB VRAM by calculating KV cache cost, choosing cache precision, and tuning llama.cpp, vLLM, or Ollama safely.

    #LLM #llamacpp #vLLM #Ollama #GPU #Self-Hosting #SelfHosting #NVidia #Hardware

    glukhov.org/llm-performance/op

  6. Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

    С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет). Вот как это выглядит: На самом деле этих калькуляторов полно и много, но почему-то у меня они показывают совсем не то что я вижу в реальности. Опять же, для меня было открытие что я могу на своей RTX3070 8Gb запускать MOE модели до 35 млрд параметров на довольно неплохой скорости, просто потому что нейронки в чатах говорят что все - конец - этого не хватит. Я думаю что они остановились в своем развитии где-то год назад и все еще частенько вспоминают про модели llama или mistral но сейчас то уже не совсем актуально, по крайней мере для использования, может для научных изысканий и нет лучше, не знаю. В общем-то и в этом калькуляторе нет никаких новых идей - просто я прогнал на своем компе несколько моделей, замерил скорость,замерил +- максимально возможный контекст, при котором llama.cpp не вылетает по нехватке памяти и попросил нейронку сделать калькулятор, чтобы он показывал цифры близкие мне, потому что расчетные цифры по контексту нейронка занижала в разы. Мне просто стало интересно почему так - она говорит что максимальный контекст 20 тысяч условно, а смог выжать 70 тысяч - разница в разы.

    habr.com/ru/articles/1076284/

    #llamacpp #llmмодели #gguf

  7. KV cache streaming - the llama.cpp fork that enables Qwen 3.8 27B at large contexts for 16GB VRAM GPU owners

    video.troed.se/w/x2AxNGkvy21Gb

  8. Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

    Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить. Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run , три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

    habr.com/ru/articles/1076080/

    #llm #ai #llamacpp #qwen #qwen38 #gguf #квантование #локальные_нейросети #локальные_модели

  9. 753B на одной видеокарте: разбор FreeToken

    Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас. Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает. Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе

    habr.com/ru/articles/1073522/

    #moe #локальные_модели #инференс #llamacpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken

  10. Чем Go полезен при разработке AI-агентов

    Всем привет! Меня зовут Илья Данилкин , я тимлид в Авито Авто . AI-агенты обычно живут рядом с Python, но всё же немало команд выбирают язык Go. Дело в том, что агенты большую часть времени не заняты сложными математическими расчётами, а ждут ответа модели или результата инструмента. А ещё работают в режиме бесконечных параллельных запусков. И если пользователь останавливает задачу, его запрос и следующие вызовы инструментов тоже нужно остановить. Поэтому при выборе языка важны не только библиотеки для работы с моделями, но и то, как язык справляется с одновременными задачами, отменяет операции и насколько просто доставить готовое приложение пользователю. В Go для этого есть дешёвые горутины, context.Context и сборка в один бинарник. В статье на примерах и материалах из Go-сообщества разберу пять сценариев, когда эти и другие свойства Go очень и очень нужны.

    habr.com/ru/companies/avito/ar

    #go #Golang #AIагенты #MCP #contextContext #горутины #llamacpp #локальные_LLM

  11. А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6

    В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему . Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что как мне кажется не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что, а задумчивой ее никак не назовешь.

    habr.com/ru/articles/1071872/

    #qwen3827B #llamacpp #gguf_conversion #llamacpp_settings

  12. Playing with the latest open weight models. Wow they are so good now compared to the last generation. Able to do a lot more on my own infra controlling all aspects! #ai #llamacpp #vllm

  13. 3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

    В марте 2026 года Google публикует пост про алгоритм сжатия памяти для языковых моделей. Звучит скучно, правда? Но акции Micron, SanDisk, Samsung, SK Hynix и других производителей памяти за неделю теряют суммарно почти $90 млрд капитализации. Инвесторы паникуют: если модели начнут тратить в разы меньше памяти, то зачем столько железа? Алгоритм, который навел весь этот шум, называется TurboQuant — герой этой статьи. Я не буду говорить, что это «революция» или «переворот в индустрии» — это было бы явное преувеличение. Но штука действительно интересная, и уже есть рабочие реализации. Если вы деплоите LLM в продакшн или просто прогоняете модели локально, то вам 100% будет полезно об этом узнать. Разберем, что из заявленного правда, а что преувеличение, и главное — как это попробовать прямо сейчас.

    habr.com/ru/companies/selectel

    #kv_cache #llm #llamacpp #sglang #vllm #selectel

  14. Qwen3.8-27B (-Q6_K) von Unsloth ist draussen.

    Reasoning auf medium setzen kann helfen. xHigh ist default, das kostet.

    Der Plan den Kilo-Code via qwen3.8-27B erstellt hat ist wirklich klasse

    #localai #llamacpp

  15. MoE на 5090 недобирает полтора раза, и дело не в маршрутизации

    RTX 5090, одна и та же сборка llama.cpp, один драйвер, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%. Маршрутизация экспертов тут почти ни при чём, я её измерил: ядра top-k занимают 7% времени. CUDA-графы захватываются, дыр между запусками нет, занятость SM 97%. Карта работает почти всё время, просто делает работу медленнее, чем позволяет память. Причина оказалась в том, сколько байт читает одно ядро за запуск. Я написал программу на ggml, которая гоняет тот же mul_mat_vec_q на холодных весах, и снял кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ уже 53%, на 33.6 МБ 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели 22.2 МБ. Вот и весь разрыв. В статье: разбивка всех 437 матвеков по трассе nsys, четыре способа померить это неправильно и посидеть в каждой ловушке по очереди, проверка модели на другой архитектуре с ошибкой 3.7% и на четырёх глубинах контекста, цена сэмплера и всей обвязки llama-server. Последнее оказалось крупнее всего остального: пользователь видит 225 токенов в секунду там, где бенчмарк показывает 317.

    habr.com/ru/articles/1069574/

    #llamacpp #moe #rtx_5090 #пропускная_способность_памяти #cuda #gpu #инференс_ллм #бенчмарк #профилирование #qwen_35

  16. 🐪🚀 Llama.cpp: Because nothing says "cutting-edge AI" like running everything on a dusty old laptop from 2010. 🤖💾 Forget the cloud, the future is apparently local... as in, locally outdated. 🖥️🔧
    llama.app #LlamaCpp #AI #LocalComputing #OutdatedTech #Innovation #HackerNews #ngated

  17. Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

    Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать. Буквально со своего MacBook Air. Ага, да вот уже сейчас прямо. Погрузиться в мир локальных моделей

    habr.com/ru/articles/1069422/

    #llm #локальные_модели #квантизация #llamacpp #apple_silicon #gguf #инференс #moe #meta

  18. 'Muse Glimmer 30B' in UD-Q4_K_XL:

    PP: ca. 500 Tokens/s
    TG: ca. 55 Tokens/s

    MB: Asus X870 AM5
    CPU: AMD Ryzen 9900x (64 GB DDR5-RAM)
    GPU: AMD Radeon AI R9700 (32 GB VRAM)
    OS: Arch-Linux

    huggingface.co/unsloth/Muse-Gl

    #localai #llamacpp

  19. Testing #localLLM again. #QuoteOfTheDay

    Q: if humankind has those non-man-given incentives as drivers for "innovation if required", rather than "innovation to sell a product noone wants": what's your opinion?

    A: We would have:

    * A stable climate.
    * Abundant, clean food.
    * Healthy, long-lasting infrastructure.
    * A society that feels secure rather than anxious.

    For long-term human wellbeing and planetary health, this is not just better—it is essential [...]"

    #Qwen3 #llamacpp #FOSS

  20. Тест локальных MOE моделей

    Я тут решил решил чуток заморочиться и протестировать локальные MOE модели на кодинг. Кодинг громко сказано - мои задачи исключительно игры причем на html, css, js. Но зато с таким набором можно сразу в продакшен, легко проверить без компиляций, кроссплатформенность ну и другие известные плюсы и минусы. На тесте побывало 10 моделей: Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4, Aurora-Code-1, Frontis, GLM 4.7 Flash, Ornith 1.0, Salience 1.5 Pro, Agents A1, GPT-oss 20b. Ссылки на модели есть в таблице результатов на которую ниже будет тоже ссылка. Многие из этих моделей сделаны на базе Qwen и тем интереснее было тестировать, потому что по бенчмаркам в карточках моделей на HF они часто превосходят своего учителя. Правда я сразу был настроен скептически и понимал что вряд ли они смогут составить реальную конкуренцию - хоть и дообучаются на кодинг, но такого рода тесты не очень как будто бы проходят, что собственно и подтверждает итоговая таблица с результатами (подсчитывал результаты Qwen3.8-Max):

    habr.com/ru/articles/1068416/

    #llm #llamacpp #игры #html