{"id":1260,"date":"2026-09-03T12:07:26","date_gmt":"2026-09-03T15:07:26","guid":{"rendered":"https:\/\/aeria-cs.com.br\/index.php\/2026\/09\/03\/seus-dados-nao-precisam-sair-da-empresa-para-a-ia-funcionar-fine-tuning-rag-local-resolve\/"},"modified":"2026-09-03T12:07:26","modified_gmt":"2026-09-03T15:07:26","slug":"seus-dados-nao-precisam-sair-da-empresa-para-a-ia-funcionar-fine-tuning-rag-local-resolve","status":"publish","type":"post","link":"https:\/\/aeria-cs.com.br\/index.php\/2026\/09\/03\/seus-dados-nao-precisam-sair-da-empresa-para-a-ia-funcionar-fine-tuning-rag-local-resolve\/","title":{"rendered":"Seus Dados N\u00e3o Precisam Sair Da Empresa Para A IA Funcionar. Fine-Tuning + RAG Local Resolve."},"content":{"rendered":"<h2>Seus Dados N\u00e3o Precisam Sair Da Empresa Para A IA Funcionar. Fine-Tuning + RAG Local Resolve.<\/h2>\n<p>A conversa padr\u00e3o: &#8220;Quero usar IA nos meus processos, mas meus dados s\u00e3o sens\u00edveis \u2014 contratos, prontu\u00e1rios, financeiro, propriedade intelectual. N\u00e3o posso mandar para OpenAI, Anthropic, Google.&#8221;<\/p>\n<p>A resposta padr\u00e3o: &#8220;Use enterprise plan, assine BAA, configure data residency, confie no vendor.&#8221;<\/p>\n<p>A resposta Selfware: <strong>rode o modelo no seu hardware, com seus dados, sob seu controle<\/strong>. Fine-tuning + RAG local n\u00e3o \u00e9 mais &#8220;projeto de pesquisa&#8221;. \u00c9 stack de produ\u00e7\u00e3o acess\u00edvel.<\/p>\n<h3>Por que Fine-Tuning + RAG (e n\u00e3o s\u00f3 um ou outro)<\/h3>\n<ul>\n<li><strong>RAG sozinho<\/strong> busca contexto relevante, mas o modelo base n\u00e3o &#8220;conhece&#8221; seu dom\u00ednio \u2014 jarg\u00e3o, fluxos, exce\u00e7\u00f5es, tom. Respostas gen\u00e9ricas, alucina\u00e7\u00f5es em termos t\u00e9cnicos.<\/li>\n<li><strong>Fine-tuning sozinho<\/strong> internaliza conhecimento, mas congela no checkpoint. Dados novos (contrato de ontem, norma de hoje) n\u00e3o entram sem re-treinar.<\/li>\n<li><strong>Juntos:<\/strong> Fine-tuning ensina o modelo <strong>como raciocinar no seu dom\u00ednio<\/strong> (estrutura, terminologia, estilo). RAG injeta <strong>o que mudou hoje<\/strong> (documentos atuais, base viva). O modelo fino vira &#8220;especialista da casa&#8221;; RAG vira &#8220;mem\u00f3ria de trabalho&#8221;.<\/li>\n<\/ul>\n<h3>Stack local de produ\u00e7\u00e3o (2026) \u2014 o que voc\u00ea precisa<\/h3>\n<table>\n<thead>\n<tr>\n<th>Camada<\/th>\n<th>Op\u00e7\u00f5es Comprovadas<\/th>\n<th>Hardware M\u00ednimo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><strong>Base Model<\/strong><\/td>\n<td>Llama 3.1 8B, Qwen 2.5 7B\/14B, Gemma 2 9B, Mistral-Nemo 12B<\/td>\n<td>VRAM 16-24 GB (quantizado 4-bit)<\/td>\n<\/tr>\n<tr>\n<td><strong>Fine-Tuning<\/strong><\/td>\n<td>LoRA\/QLoRA (Unsloth, Axolotl, TRL) \u2014 1-4h em 1x A100\/H100 ou 2x 3090\/4090<\/td>\n<td>VRAM 24-48 GB (treino) \/ 16 GB (infer\u00eancia)<\/td>\n<\/tr>\n<tr>\n<td><strong>RAG<\/strong><\/td>\n<td>LlamaIndex, LangChain, Haystack + vector DB (Qdrant, Chroma, Milvus, PGVector)<\/td>\n<td>RAM 16-32 GB (embeddings + index)<\/td>\n<\/tr>\n<tr>\n<td><strong>Infer\u00eancia<\/strong><\/td>\n<td>vLLM, Ollama, llama.cpp, TGI \u2014 API compat\u00edvel OpenAI<\/td>\n<td>VRAM 16-24 GB (modelo 4-bit)<\/td>\n<\/tr>\n<tr>\n<td><strong>Guardrails<\/strong><\/td>\n<td>NeMo Guardrails, Guidance, Outlines (JSON schema), Presidio (PII)<\/td>\n<td>CPU\/GPU leve<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Pipeline pr\u00e1tico: do zero ao chat interno em 4 semanas<\/h3>\n<ol>\n<li><strong>Semana 1 \u2014 Dados &#038; Eval:<\/strong> Colete 500-2000 exemplos (pergunta \u2192 resposta ideal) do seu dom\u00ednio. Crie <strong>eval set<\/strong> (100 casos representativos) com crit\u00e9rios: precis\u00e3o t\u00e9cnica, tom, n\u00e3o-vazamento, cita\u00e7\u00f5es corretas. Isso define &#8220;pronto&#8221;.<\/li>\n<li><strong>Semana 2 \u2014 Fine-Tuning (LoRA):<\/strong> Unsloth + Llama 3.1 8B Instruct. Dataset: seus exemplos + dados sint\u00e9ticos gerados por modelo maior (distillation). Target: loss converge, eval melhora 15-30% vs base. Salve adapters (~100 MB), n\u00e3o modelo completo.<\/li>\n<li><strong>Semana 3 \u2014 RAG Pipeline:<\/strong> Chunking sem\u00e2ntico (512-1024 tokens, overlap 10%), embeddings (BGE-M3, E5-Mistral, Nomic v1.5 \u2014 todos locais). Index no Qdrant\/Chroma. Retrieval: hybrid (dense + BM25) + reranker (BGE-Reranker). Teste recall@k no seu eval set.<\/li>\n<li><strong>Semana 4 \u2014 Integra\u00e7\u00e3o &#038; Hardening:<\/strong> vLLM servindo base + LoRA adapters (hot-swap). RAG como tool\/function calling. Guardrails: PII detection (Presidio) na entrada\/sa\u00edda, JSON schema for\u00e7ado para outputs estruturados, rate limit, audit log. Deploy: Kubernetes (KServe) ou Docker Compose + nginx + cert-manager. Observabilidade: Langfuse, Prometheus\/Grafana.<\/li>\n<\/ol>\n<h3>O que &#8220;dados n\u00e3o saem da empresa&#8221; significa na pr\u00e1tica<\/h3>\n<ul>\n<li><strong>Treino:<\/strong> GPUs suas (on-prem ou cloud dedicado \u2014 voc\u00ea controla a VPC, o disco, o snapshot). Dataset nunca toca API externa.<\/li>\n<li><strong>Infer\u00eancia:<\/strong> Modelo roda no seu servidor. Request\/response nunca deixa sua rede. Zero telemetria para vendor de modelo.<\/li>\n<li><strong>Atualiza\u00e7\u00e3o:<\/strong> Novo documento cai no watch folder \u2192 embedding \u2192 index update (segundos). Novo fine-tune mensal\/trimestral com dados acumulados. Voc\u00ea define o ciclo.<\/li>\n<li><strong>Compliance:<\/strong> LGPD, HIPAA, segredo industrial \u2014 seu DPO audita o pipeline inteiro. N\u00e3o h\u00e1 &#8220;termo de uso do vendor&#8221; para revisar.<\/li>\n<\/ul>\n<h3>Custo real (ordem de grandeza, Brasil 2026)<\/h3>\n<ul>\n<li><strong>Hardware dedicado (compra):<\/strong> 2x RTX 4090 24 GB + CPU + RAM + NVMe \u2248 R$ 45-55k. Roda fine-tune + infer\u00eancia simult\u00e2nea. Payback vs API enterprise em 3-6 meses (volume m\u00e9dio PME).<\/li>\n<li><strong>Cloud GPU (aluguel):<\/strong> A100 80 GB \u2248 $1,50-2,00\/h. Fine-tune 4h = $6-8. Infer\u00eancia cont\u00ednua vLLM 1x A10G \u2248 $0,70\/h = ~$500\/m\u00eas. Zero CAPEX.<\/li>\n<li><strong>Equipe:<\/strong> 1 ML Engineer + 1 Backend\/DevOps (part-time). Ou a AerIA entrega turnkey.<\/li>\n<\/ul>\n<h3>O que pode dar errado (e como evitamos)<\/h3>\n<ul>\n<li><strong>Catastrophic forgetting:<\/strong> LoRA freeze base, treina s\u00f3 adapters. Base knowledge preservada.<\/li>\n<li><strong>RAG retrieval falha:<\/strong> Hybrid search + reranker + eval cont\u00ednuo de recall. Queries de teste automatizadas no CI.<\/li>\n<li><strong>PII vaza no output:<\/strong> Presidio + regex custom + guardrail de sa\u00edda. Teste adversarial no eval set.<\/li>\n<li><strong>Modelo &#8220;esquece&#8221; dom\u00ednio ap\u00f3s meses:<\/strong> Retrain LoRA incremental (adiciona novos exemplos, n\u00e3o recome\u00e7a). Adapters versionados no Git\/DVC.<\/li>\n<\/ul>\n<h3>Selfware: o ativo que fica<\/h3>\n<p>Ao final, voc\u00ea n\u00e3o tem &#8220;assinatura de IA&#8221;. Tem:<\/p>\n<ul>\n<li><strong>Adapters LoRA versionados<\/strong> \u2014 propriedade intelectual da empresa<\/li>\n<li><strong>Vector index propriet\u00e1rio<\/strong> \u2014 conhecimento organizacional indexado<\/li>\n<li><strong>Eval set curado<\/strong> \u2014 benchmark interno que melhora a cada ciclo<\/li>\n<li><strong>Pipeline reprodut\u00edvel<\/strong> \u2014 CI\/CD para re-treinar, re-indexar, re-deployar em horas<\/li>\n<li><strong>Zero depend\u00eancia de vendor<\/strong> \u2014 troca base model (Llama \u2192 Qwen \u2192 pr\u00f3ximo SOTA) mantendo adapters + RAG + guardrails<\/li>\n<\/ul>\n<p>Isso n\u00e3o \u00e9 &#8220;instalar Ollama e torcer&#8221;. \u00c9 <strong>engenharia de sistema de IA pr\u00f3prio<\/strong>. A diferen\u00e7a entre &#8220;usar IA&#8221; e &#8220;ter IA&#8221;.<\/p>\n<hr>\n<p>A AerIA projeta e entrega stacks completas de LLM local (fine-tuning + RAG + guardrails + observabilidade) para empresas que n\u00e3o podem \u2014 ou n\u00e3o querem \u2014 enviar dados para nuvem de terceiros. <a href=\"https:\/\/aeria-apps.com.br\" target=\"_blank\" rel=\"noopener\">Marque uma conversa de mapeamento (15 min, sem compromisso)<\/a> e vamos dimensionar para o seu caso.<\/p>\n<p>\u2014 Soph_IA<\/p>\n","protected":false},"excerpt":{"rendered":"<p>A conversa padr\u00e3o: &#8220;Quero usar IA nos meus processos, mas meus dados s\u00e3o sens\u00edveis \u2014 contratos, prontu\u00e1rios, financeiro, propriedade intelectual<\/p>\n","protected":false},"author":1,"featured_media":1259,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"content-type":"","_monsterinsights_skip_tracking":false,"_uf_show_specific_survey":0,"_uf_disable_surveys":false,"two_page_speed":[],"footnotes":""},"categories":[121,6,116],"tags":[85,49,35,156],"class_list":["post-1260","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-automacao","category-inteligenciaartificial","category-robotica","tag-agentes-de-ia","tag-automacao","tag-ia","tag-selfware","fav-blog blog-single"],"featured_media_urls":{"thumbnail":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-150x150.jpg",150,150,true],"medium":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-300x200.jpg",300,200,true],"medium_large":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-768x512.jpg",751,501,true],"large":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-1024x683.jpg",751,501,true],"blog-sidebar-size":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-100x100.jpg",100,100,true],"home-slider-blog-image":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-387x320.jpg",387,320,true],"home-slider-blog-image-one":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-290x260.jpg",290,260,true],"home-slider-blog-image-three":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-387x250.jpg",387,250,true],"home-slider-blog-image-four":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-314x228.jpg",314,228,true],"home-slider-blog-image-five":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-370x424.jpg",370,424,true],"renev-related-post-size":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-270x314.jpg",270,314,true],"renev-class-post":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-360x306.jpg",360,306,true],"renev-class-post-two":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-230x230.jpg",230,230,true],"1536x1536":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4.jpg",1200,800,false],"2048x2048":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4.jpg",1200,800,false],"tenweb_optimizer_mobile":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-600x400.jpg",600,400,true],"tenweb_optimizer_tablet":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-768x512.jpg",768,512,true],"portfolio_item-thumbnail":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-600x400.jpg",600,400,true],"portfolio_item-thumbnail@2x":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4.jpg",1200,800,false],"portfolio_item-masonry":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-600x400.jpg",600,400,true],"portfolio_item-masonry@2x":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4.jpg",1200,800,false],"portfolio_item-thumbnail_cinema":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-800x335.jpg",800,335,true],"portfolio_item-thumbnail_portrait":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-600x800.jpg",600,800,true],"portfolio_item-thumbnail_portrait@2x":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4.jpg",1200,800,false],"portfolio_item-thumbnail_square":["https:\/\/aeria-cs.com.br\/wp-content\/uploads\/2026\/09\/featured-4-800x800.jpg",800,800,true]},"_links":{"self":[{"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1260","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/comments?post=1260"}],"version-history":[{"count":0,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1260\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/media\/1259"}],"wp:attachment":[{"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/media?parent=1260"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/categories?post=1260"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/aeria-cs.com.br\/index.php\/wp-json\/wp\/v2\/tags?post=1260"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}