{"id":1554,"date":"2025-12-09T09:12:09","date_gmt":"2025-12-09T08:12:09","guid":{"rendered":"https:\/\/germanmallo.com\/?p=1554"},"modified":"2026-10-05T08:15:38","modified_gmt":"2026-10-05T06:15:38","slug":"llms-en-local-vs-nube-mi-experiencia-personal-y-la-realidad-del-hardware","status":"publish","type":"post","link":"https:\/\/germanmallo.com\/en\/llms-en-local-vs-nube-mi-experiencia-personal-y-la-realidad-del-hardware\/","title":{"rendered":"On-premises vs. cloud LLMs: My personal experience and the hardware reality"},"content":{"rendered":"<p>Llevo meses en esta encrucijada. Por un lado, la comodidad insultante de abrir ChatGPT o Claude y tener al modelo m\u00e1s inteligente del mundo a un clic. Por otro, la inquietud de enviarle todos mis datos, borradores y c\u00f3digo a servidores ajenos.<\/p>\n<p>La fiebre de la IA nos ha dividido en dos bandos: los que pagan la suscripci\u00f3n sin mirar atr\u00e1s y los que se compran gr\u00e1ficas con mucha VRAM para \u00abser due\u00f1os\u00bb de su inteligencia.<\/p>\n<p>He probado ambos mundos a fondo. He montado flujos con <strong>Ollama y LM Studio<\/strong> y he quemado cr\u00e9ditos de la API de <strong>OpenAI y Anthropic<\/strong>.<\/p>\n<p>Esta es la realidad, sin tecnicismos innecesarios, de ejecutar LLMs en local frente a la nube.<\/p>\n<h2 id=\"la-nube-potencia-bruta-a-golpe-de-tarjeta-saas-\">La Nube: Potencia bruta a golpe de tarjeta (SaaS)<\/h2>\n<p>Cuando usas GPT-4o, Claude 3.5 Sonnet o Gemini 1.5 Pro, est\u00e1s alquilando un cerebro gigante.<\/p>\n<h3 id=\"lo-bueno\">Lo bueno<\/h3>\n<ul>\n<li><strong>Inteligencia Superior:<\/strong> A d\u00eda de hoy, ning\u00fan modelo que puedas correr en un port\u00e1til de consumo se acerca al razonamiento l\u00f3gico de Claude 3.5 Sonnet o GPT-4. Para picar c\u00f3digo complejo o razonamiento l\u00f3gico profundo, la nube sigue ganando.<\/li>\n<li><strong>Cero Fricci\u00f3n:<\/strong> No instalas nada. No configuras entornos. No te preocupas por si tu ventilador suena como un avi\u00f3n despegando. Es productividad pura.<\/li>\n<li><strong>Multimodalidad Real:<\/strong> El an\u00e1lisis de im\u00e1genes y archivos pesados suele funcionar mucho mejor y m\u00e1s r\u00e1pido en sus servidores.<\/li>\n<\/ul>\n<h3 id=\"lo-malo\">Lo malo<\/h3>\n<ul>\n<li><strong>Privacidad:<\/strong> Es el elefante en la habitaci\u00f3n. Todo lo que escribes, salvo que uses configuraciones Enterprise muy espec\u00edficas, <em>podr\u00eda<\/em> ser usado para entrenar futuros modelos. \u00bfDatos financieros? \u00bfC\u00f3digo propietario? Mejor no.<\/li>\n<li><strong>Coste recurrente:<\/strong> Los 20\u20ac\/mes o el pago por uso de API se acumulan.<\/li>\n<li><strong>Censura y Guardrails:<\/strong> Los modelos en la nube suelen ser m\u00e1s \u00abpol\u00edticamente correctos\u00bb y se niegan a responder ciertas cosas por filtros de seguridad excesivos.<\/li>\n<\/ul>\n<h2 id=\"llms-en-local-la-rebeli-n-de-la-privacidad\"><a href=\"https:\/\/www.datacamp.com\/es\/tutorial\/run-llms-locally-tutorial\">LLMs en Local<\/a>: La rebeli\u00f3n de la privacidad<\/h2>\n<p>Aqu\u00ed es donde entran jugadores como <strong>Llama 3 (Meta)<\/strong>, <strong>Mistral<\/strong>, <strong>Gemma (Google)<\/strong> o <strong>Phi (Microsoft)<\/strong>. Herramientas como <a href=\"https:\/\/ollama.com\/\">Ollama<\/a> han democratizado esto a un nivel absurdo.<\/p>\n<h3 id=\"lo-bueno\">Lo bueno<\/h3>\n<ul>\n<li><strong>Privacidad Absoluta:<\/strong> Puedes desconectar el cable de red y la IA sigue funcionando. Tus datos nunca salen de tu m\u00e1quina. Esto, para temas legales o personales, no tiene precio.<\/li>\n<li><strong>Sin Censura:<\/strong> Puedes descargar versiones \u00abuncensored\u00bb de los modelos si necesitas que la IA no te d\u00e9 lecciones de moralidad al escribir una novela de ficci\u00f3n.<\/li>\n<li><strong>Latencia Cero (casi):<\/strong> Si tienes el hardware, la respuesta es instant\u00e1nea. No hay colas de espera ni \u00abel servidor est\u00e1 saturado\u00bb.<\/li>\n<li><strong>Gratis (una vez tienes el hardware):<\/strong> Descargar y correr Llama 3 es gratis.<\/li>\n<\/ul>\n<h3 id=\"el-ba-o-de-realidad-el-hardware\">El ba\u00f1o de realidad: <a href=\"https:\/\/germanmallo.com\/en\/mi-pc-y-sus-componentes\/\">El Hardware<\/a><\/h3>\n<p>Aqu\u00ed es donde muchos chocan contra la pared. <strong>La IA local devora VRAM (Memoria de Video) y RAM<\/strong>.<\/p>\n<p>Mi experiencia personal:<\/p>\n<ul>\n<li><strong>Con 8GB de RAM:<\/strong> Olv\u00eddalo. Solo podr\u00e1s correr modelos muy peque\u00f1os y \u00abtontos\u00bb (quantizaciones muy agresivas).<\/li>\n<li><strong>Con 16GB de RAM\/VRAM:<\/strong> El punto dulce de entrada. Puedes correr modelos de 7B o 8B par\u00e1metros (como Llama 3 8B) con una velocidad decente.<\/li>\n<li><strong>Mac con Apple Silicon (M1\/M2\/M3):<\/strong> Aqu\u00ed cambia el juego. La memoria unificada de los Mac permite asignar mucha RAM a la GPU. Un Mac con 32GB o 64GB es una bestia para IA local.<\/li>\n<\/ul>\n<blockquote><p><strong>Nota t\u00e9cnica:<\/strong> Si intentas correr un modelo m\u00e1s grande que tu memoria VRAM, el sistema usar\u00e1 la RAM normal y la CPU. El resultado: tu ordenador generar\u00e1 1 palabra por segundo. Inviable para trabajar.<\/p><\/blockquote>\n<h2 id=\"mi-veredicto-y-flujo-de-trabajo-h-brido\">Mi veredicto y flujo de trabajo h\u00edbrido<\/h2>\n<p>No tienes que elegir uno. La clave de la productividad es saber <strong>cu\u00e1ndo usar qu\u00e9<\/strong>.<\/p>\n<p>Tras muchas pruebas, este es mi sistema actual:<\/p>\n<h3 id=\"1-uso-local-ollama-obsidian-vs-code-\">1. Uso Local (Ollama + Obsidian\/VS Code)<\/h3>\n<p>Lo uso para tareas repetitivas, r\u00e1pidas o sensibles.<\/p>\n<ul>\n<li><strong>Resumir notas personales:<\/strong> No quiero que mis diarios o estrategias de negocio est\u00e9n en la nube.<\/li>\n<li><strong>Correcci\u00f3n de estilo b\u00e1sica:<\/strong> Un Llama 3 local es excelente reescribiendo emails o p\u00e1rrafos.<\/li>\n<li><strong>Copilot de c\u00f3digo simple:<\/strong> Autocompletado r\u00e1pido que no requiere contexto de todo el proyecto.<\/li>\n<\/ul>\n<h3 id=\"2-uso-en-nube-claude-3-5-sonnet-gpt-4o-\">2. Uso en Nube (Claude 3.5 Sonnet \/ GPT-4o)<\/h3>\n<p>Lo reservo para \u00abtrabajo pesado\u00bb.<\/p>\n<ul>\n<li><strong>Arquitectura de Software:<\/strong> Cuando necesito planear una estructura de base de datos compleja.<\/li>\n<li><strong>Razonamiento L\u00f3gico:<\/strong> \u00ab\u00bfD\u00f3nde est\u00e1 el fallo en este argumento?\u00bb<\/li>\n<li><strong>Generaci\u00f3n de c\u00f3digo complejo:<\/strong> Cuando necesito un script entero de Python que funcione a la primera.<\/li>\n<\/ul>\n<h2 id=\"conclusi-n\">Conclusi\u00f3n<\/h2>\n<p>Si tienes un equipo con una buena GPU (NVIDIA RTX 3060 en adelante) o un Mac con Apple Silicon, <strong>instala Ollama hoy mismo<\/strong>. Tener un asistente local, privado y r\u00e1pido para tareas menores cambia tu flujo de trabajo y te da una capa de seguridad extra.<\/p>\n<p>Pero no nos enga\u00f1emos: si necesitas razonamiento de nivel genio para resolver un problema complejo, <strong>sigue pagando la suscripci\u00f3n<\/strong>. La IA local avanza r\u00e1pido, pero los gigantes de la nube todav\u00eda tienen la corona de la inteligencia bruta.<\/p>\n<p>La pregunta es: \u00bfCu\u00e1nto valoras tu privacidad frente a la comodidad?<\/p>","protected":false},"excerpt":{"rendered":"<p>Llevo meses en esta encrucijada. Por un lado, la comodidad insultante de abrir ChatGPT o Claude y tener al modelo m\u00e1s inteligente del mundo a un clic. Por otro, la inquietud de enviarle todos mis datos, borradores y c\u00f3digo a servidores ajenos. La fiebre de la IA nos ha dividido en dos bandos: los que [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":1557,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[76],"tags":[223,222,126,121],"class_list":["post-1554","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ia","tag-hardware","tag-ia-local","tag-llm","tag-privacidad"],"acf":[],"_links":{"self":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1554","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/comments?post=1554"}],"version-history":[{"count":1,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1554\/revisions"}],"predecessor-version":[{"id":4538,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1554\/revisions\/4538"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/media\/1557"}],"wp:attachment":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/media?parent=1554"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/categories?post=1554"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/tags?post=1554"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}