Construo sistemas de IA que chegam à produção — e permanecem lá.
Uma década de engenharia em produção — Salesforce, dLocal, The Sandbox. Hoje, IA que conduz mais de 15.000 conversas por mês com 90%+ de precisão.
Atualmente Engenheiro de IA na SignalCore AI, construindo sistemas autônomos de decisão para empresas.
Um engenheiro de backend que migrou para a camada de IA — e a leva à produção.
Sou Ramiro González, engenheiro de software com uma década construindo sistemas de backend para empresas como Salesforce, dLocal e The Sandbox. Nos últimos anos me dediquei inteiramente à IA — tirando modelos de linguagem do demo e levando-os à produção, onde são as pessoas reais e a carga real que os quebram.
Não vendo serviços empacotados. Assumo um projeto e vou com tudo: mapeio como o trabalho acontece hoje, coloco algo rodando em semanas e entrego um código que é totalmente seu. Baseado em Florianópolis, Brasil, trabalho em horários que cobrem os EUA e a maior parte da Europa.
Cinco competências — cada uma com algo entregue por trás.
Sou um engenheiro, não uma agência — então vou fundo, não largo. Este é o terreno que cubro quando assumo um projeto.
Arquitetura RAG
90%+ de relevância nas respostas, com citações; 65% menos alucinações via chunking semântico e busca híbrida.
Orquestração de agentes
10+ agentes em produção, coordenando ferramentas, memória e handoff humano.
Sistemas LLM em escala
15.000+ conversas por mês, mantendo a precisão sob carga real de produção.
Avaliação & guardrails
Todo sistema já vem com avaliações LLM-as-judge, monitoramento de custo e latência e escalonamento embutido.
Backend em escala
120 mil usuários ativos por mês no The Sandbox; infraestrutura de pagamentos transfronteiriços na dLocal.
Como é, na prática, trabalhar comigo.
Começamos com uma conversa de 15 minutos. Grátis. Se não fizer sentido, eu te digo ali mesmo.
Mapeio o processo antes de escrever código. A maioria dos projetos de IA falha por automatizar um processo quebrado mais rápido. Primeiro quero ver como o trabalho acontece hoje.
Algo roda até a terceira ou quarta semana, mesmo que limitado. Um sistema que você usa mal vence um que só dá para discutir.
Vou te dizer o que a IA não deve fazer. Todo projeto tem uma linha onde a máquina para e uma pessoa começa. Traçá-la cedo é a maior diferença entre um sistema em produção e um demo.
O código é seu. Repositório, infraestrutura, prompts — tudo, desde o primeiro dia.
Baseado em Florianópolis (UTC−3) · horário sobreposto aos EUA e à maior parte da Europa · Inglês · Português · Espanhol
Nichos em que já entreguei.
Se o seu mundo está nesta lista, eu já construí para ele — como o primeiro contratado de IA de um fundador, ou como o engenheiro por trás do produto.
Um SDR de IA sempre ativo para clínicas estéticas.
Transforma leads do WhatsApp em consultas agendadas — e entrega ao closer apenas quem está pronto para comprar.
O trabalho do agente é levar vinte e cinco pessoas qualificadas a um closer humano. Não fechar por ele.
A clínica — que vou chamar de Concierge Doctor — funcionava toda no WhatsApp. Quando dez leads chegavam juntos, o décimo esperava duas horas. Lead de estética é por impulso — uma resposta em duas horas é um lead perdido.
A clínica respondia cerca de um quarto do que conseguia gerar, então não dava para investir em tráfego — mais anúncios só aumentavam a fila. Os agendamentos ficavam em cinco por mês.
Um concierge de WhatsApp que qualifica, nutre e faz follow-up 24/7. Por trás, um painel de operações que pontua cada lead, escreve um resumo para o closer humano e agenda a consulta.
- —500 leads atendidos
- —Primeira resposta em menos de 30 segundos, independente do volume
- —Consultas agendadas 5 → 25 por mês
Com o ticket médio de R$5.000 da clínica, vinte consultas a mais representam cerca de R$100.000/mês em novo pipeline de consultas.
O agente repassa para um humano em exatamente três gatilhos: falha em resolver uma objeção após três tentativas, o lead pede uma pessoa, ou ele detecta que não tem a informação para responder corretamente.
O terceiro é o que mais importa. A maioria dos bots de clínica falha improvisando diante de uma lacuna — um preço inventado, um resultado prometido. Isso custa confiança e pode custar um tratamento. Então o sistema reconhece o limite do próprio conhecimento e para ali.
O mesmo sistema, rodando com um lead fictício.
O WhatsApp é só o transporte. A lógica de qualificação, pontuação e resumo para o closer é o produto — roda igual em um chat, um formulário ou a transcrição de uma ligação.
Telas do sistema em produção — a interface real por trás da demonstração acima.
Suporte que responde a partir da documentação — e sabe quando não pode.
Um agente de recuperação sob medida embarcado em um produto de ed-tech. Respostas instantâneas e citadas — e um escalonamento limpo assim que ele fica em dúvida.
* Números ilustrativos — dados finais de produção pendentes.
O agente responde o que a documentação já sabe — e encaminha todo o resto para uma pessoa, rápido.
Uma empresa de ed-tech em crescimento — equipe pequena, milhares de professores e alunos. O suporte eram poucas pessoas respondendo as mesmas perguntas por e-mail e chat. A central de ajuda era dispersa, então a resposta dependia de quem respondia.
Com o crescimento dos cadastros, os tempos de resposta pioraram. Contratar mais atendentes escala custo, não consistência — e a fila que mais crescia eram as mesmas cinquenta perguntas feitas de cem formas.
Um agente com RAG sob medida, embarcado no produto como um widget. Ele responde apenas a partir de uma base de conhecimento curada e padronizada, sempre com citações, e escala assim que a confiança da recuperação cai ou a pergunta sai do escopo.
- —71% das conversas resolvidas de ponta a ponta sem humano
- —90%+ de acurácia contra um conjunto golden Q&A
- —Primeira resposta 4h → <5s
- —Suporte escalou com os cadastros, sem novas contratações
Toda resposta é fundamentada em uma fonte aprovada e mostra as citações. Quando o score de recuperação cai abaixo do limite — ou a pergunta sai do escopo, como preço ou algo específico da conta — o agente não improvisa. Ele escala com a conversa inteira anexada.
Uma resposta de suporte confiantemente errada é pior que uma lenta: ensina algo falso ao usuário e corrói silenciosamente a confiança no produto.
Uma pergunta, rastreada de ponta a ponta.
O widget é o que o usuário vê. O rastro ao lado é o pipeline de recuperação que produziu a resposta — e o guardrail que escala em vez de chutar.
Memória de decisões para escritórios de arquitetura.
Transforma as reuniões que já acontecem em um registro pesquisável de cada decisão — quem tomou, por quê e o que mudou.
Pré-lançamento · em piloto com a souBIM, um escritório de arquitetura em Florianópolis
A souBIM toca três ou mais projetos ao mesmo tempo. Cada mudança de material, revisão estrutural e decisão de orçamento acontecia num Google Meet — e vivia só na cabeça da Gabriela, a diretora. Nada era registrado.
Então Gabriela agendou dois a três meses de licença-maternidade. Cerca de cinquenta decisões por projeto seriam tomadas sem ela. Não era um problema de licença — era de escala: o escritório não conseguia crescer além da memória de uma pessoa.
Cada decisão, filtrável e atribuída — exibida como uma linha do tempo do projeto e um resumo “enquanto você esteve fora”.
- —150–200 decisões por mês capturadas sem atrito nas reuniões
- —Reunião termina → decisão registrada em menos de 4 horas
O sistema extrai e estrutura decisões — nunca as toma ou aprova. Ele registra consenso e divergência em vez de suavizá-los numa resposta limpa, e pontua a própria confiança em cada extração.
Quando uma decisão tem baixo consenso ou contradiz uma anterior, ele sinaliza para a diretora em vez de afirmar um registro arrumadinho. Um log de decisões confiantemente errado é pior que um sinalizado como incerto — num edifício, confiança é estrutural.
O trabalho do sistema é devolver à diretora a memória dela. Não tomar as decisões por ela.
Outros projetos, em outros mundos.
Mais alguns, em estágios diferentes — dois rodando agora e um que venceu uma competição e depois foi para clientes pagantes.
AI Librarian para uma plataforma de educação financeira
Um agente dentro do produto que responde a partir dos vídeos e das aulas da plataforma, guiando os membros na jornada de aprendizagem rumo a resultados reais.
Ligações de projeto viram uma base de conhecimento pesquisável
Transformei as gravações de reuniões de um escritório de arquitetura em uma plataforma de conteúdo pesquisável. Entregue no Upwork com avaliação cinco estrelas do cliente.
“Fiquei profundamente impressionado com seu conhecimento de sistemas RAG, a comunicação clara e a profundidade do entendimento arquitetural.”
Clones digitais de como uma pessoa decide e fala
Sistemas com chain-of-thought e few-shot e voz da ElevenLabs, replicando as decisões e o estilo de uma pessoa. Primeiro de 200 na Academia Lendária e, depois, entregue a três clientes pagantes.
Uma década de engenharia em produção.
Atuação independente, por contrato — de CRM em nuvem e pagamentos transfronteiriços aos sistemas de IA acima.