Lucas Hiago

Arquiteto de Sistemas Orientado a Resultados

Mais de uma década construindo e escalando plataformas, de e-commerce a engine de jogo própria em C++, hoje unindo arquitetura sólida e IA aplicada para transformar tecnologia em resultado de negócio.

Produtos construídos 40 produtos, uma seção para cada um · com maquete da tela
Quem é Lucas Hiago?

Engenheiro de Software Sênior, de Belo Horizonte, com mais de 10 anos de estrada: começou em 2015 em suporte técnico e e-commerce em PHP e hoje arquiteta sistemas multiagente de IA e escreve a própria engine gráfica em C++. Não constrói modelo: constrói o sistema em volta dele.

Três coisas o definem tecnicamente
  • Domar legado sem parar a entrega. Três migrações de major do Angular com o produto no ar: 8 → 16 no framework de e-commerce NEO, 9 → 14 (mais Node → 18) na loja Elegance da JET e 16 → 19 no Portal de Suporte da TOTVS.
  • IA aplicada onde ela se paga. Agentes, RAG, orquestração e guardrails com ponto de parada humano. Leitura é barata, escrita é cara: o agente lê à vontade dentro do allowlist, propõe numa fila e um humano assina o que muda estado.
  • YAGNI radical. Engine própria em C++, SDL e OpenGL em vez de Unity ou Unreal; nenhuma biblioteca de estado quando o estado é só cache de servidor.
Os números por trás disso
  • Subsistema de IA de ~7 mil linhas dentro de uma base Laravel de 134 mil (228 endpoints, 156 models), com streaming SSE, Whisper/Vision e roteamento multi-modelo, na NETPROJECT.
  • Contexto de um time de 6 devs sobre 18 projetos de 377K para 28K tokens por tarefa (−68%), com o padrão slim rule + skill sob demanda.
  • 4 temas comerciais sobre um único núcleo: catálogo, carrinho e checkout no core; tema é camada de apresentação, sem regra de negócio.
  • main.js de 26 mil linhas decomposto em centenas de módulos, com o webpack reestruturado para cada projeto importar só o que usa.
  • Mais de 600 rotas prerenderizadas em Angular 19 com SSR, hidratação com event replay e transfer cache do HTTP.
  • Fluxo agêntico sobre um ecossistema de 19+ microsserviços, com uma worktree por serviço virando um MR. E um monorepo de 5 sub-projetos entregue em 4 meses.
Como trabalha
  • Legado se moderniza em passos, não em reescrita: uma major por vez, com smoke test entre elas.
  • Caminho de erro é requisito, não extra: testa 500, API fora do ar e lista de validação, não só o happy path.
  • Responsabilidade centralizada, decisão distribuída: o interceptor traduz o erro e avisa, mas relança: quem decide o que a tela faz é o componente.
  • Todo bug corrigido nasce com um teste que falha antes do fix.

Fora do cliente: o livro DE VOLTA aos FUNDAMENTOS (fev/2026), 11 páginas didáticas interativas em PT, EN e ES onde a conta roda de verdade no navegador, e mais de 120 artigos no blog da Steply.

Trajetória completa em perfil-completo.md e respostas técnicas detalhadas no FAQ técnico.

Marcos de desenvolvimento
2013 a 2015 Freelancer: do zero às primeiras entregas reais
  • Freelancer na Workana: primeiros contratos e entregas reais.
  • Landing pages, sites institucionais e WordPress para agências de marketing.
  • Web scraping em PHP para coleta e automação de dados.
  • Primeira escola de escopo, prazo e bug em produção.
2015 a 2020 Consolidação fullstack: agências, e-commerce e o salto pro Angular
  • Consolidação como front-end e fullstack passando por Romana Informática, BITS&GAMES, 2ck e Agência Open.
  • Romana (2015 a 2016): suporte, infraestrutura e e-commerce em PHP; base sólida de diagnóstico e rede.
  • BITS&GAMES (2016 a 2017): WordPress e lojas MercadoShops, com forte personalização de temas.
  • 2ck (2017 a 2018): e-commerce profissional (Rakuten, Tray, Jet); ritmo intenso e múltiplos clientes.
  • Agência Open (2019 a 2020): virada de WordPress para Angular; Real Estate e suporte a .NET/CSHTML (MRV).
  • 2020, Alpes.One / Carbel: refatoração de um main.js de 26 mil linhas.

    Landing pages e sites institucionais full-stack com October CMS e Laravel, HTML semântico, arquitetura SCSS e módulos ES6. O main.js monolítico virou centenas de módulos com webpack reestruturado.

    LaravelOctober CMSSCSSES6webpack
2021 a 2024 Produto, liderança técnica e a virada consultiva
  • JET (fev/2021 a nov/2023): Frontend Developer nas plataformas Virtuol Pro e NEO.

    Front-ends Angular escaláveis atendendo múltiplas lojas em produção: 4 temas comerciais, biblioteca de componentes modulares reutilizada entre lojas, produto Elegance (Angular + API Node) e a migração do NEO v3 de Angular 8x para 16x.

    AngularNodeTypeScriptSCSS
  • Loja Virtuol: quatro temas comerciais; liderança no upgrade Angular 9 → 14 e Node → 18 (vulnerabilidades corrigidas).
  • Serviços Profissionais com foco em .NET, em ambientes corporativos e stacks heterogêneas.
  • SQUADEVOPS (nov/2020 a mar/2024): projetos ponta a ponta, da UI ao real-time.

    Entregas completas em Angular, Svelte, NestJS e TypeScript, incluindo videochamada com WebRTC (sinalização e ICE relay), com foco em modularização e escalabilidade.

    AngularSvelteNestJSWebRTC
  • Supero Tecnologia (mar/2024 a ago/2026): alocado na TOTVS, produto corporativo de grande porte.

    Atuação no portal de suporte da TOTVS: migração da aplicação Angular da versão 16 para 19 integrada ao Zendesk, e evolução e sustentação de serviços Java legados no backend corporativo.

    JavaAngularZendeskAzure
  • 2024: virada estratégica, reposicionamento da SQUADEVOPS e início da atuação consultiva.
2025 a 2026 Steply, livro publicado e referência em arquitetura
  • Steply consolidada como CTO as a Service (Brasil e exterior).

    Fractional CTO e consultoria: arquitetura, mentoria de times e produto próprio, SaaS em Angular 19 + NestJS + Socket.io, SDD harness com agentes de IA e blog com build SSR automatizado.

    Angular 19NestJSSocket.ioIA
  • Arquiteturas escaláveis, mentoria de times e otimização de infra (custo operacional e previsibilidade).
  • Senior Software Engineer na Supero: portal de suporte da TOTVS, Angular 15+ e Azure.

    Alocado no portal de suporte da TOTVS: Angular 15+, Azure DevOps e integração Zendesk, com sustentação de serviços Java no backend.

    Angular 15+AzureZendeskJava
  • Fev/2026: lançamento do livro DE VOLTA aos FUNDAMENTOS: fundamentos, arquitetura sólida e construção consciente.
  • NETPROJECT (mar/2025 a atual): líder de implementação de IA na plataforma de PMO.

    Subsistema de IA de ~7K LOC numa plataforma Laravel de 134K LOC: 9 agentes Creators, extração de documentos com 6 drivers, streaming por SSE, AutoTimesheet e n8n self-hosted como camada de automação.

    LaravelOpenAISSEn8nMCP
  • Vibbra / NEO Interact (jan/2025 a jul/2026): consultor de tooling de IA.

    Squad Cognitivo: 6 agentes de IA especializados guiados por 59 guidelines sobre um ecossistema de 18 projetos (15 microsserviços Node + React), com o padrão slim rule + skill que cortou 68% do custo de tokens.

    AgentesNodeReactClaude Code
  • Transição de executor técnico para referência em fundamentos e arquitetura.
Resultados entregues

O que empresas ganharam com meu trabalho, medido em produto no ar, custo cortado e capacidade nova, não em horas apontadas.

NETPROJECT · 2026

MCP corporativo da plataforma

A plataforma deixou de ser operada só por cliques: criamos o MCP que a expõe para agentes de IA.

  • Servidor Model Context Protocol sobre o produto existente
  • Consulta, automação e integração sem reescrever nada
MCPAgentesIntegração
Cliente privado

Plataforma de captação com voucher único

Captação de leads do formulário ao banco: cadastro vira conversão rastreável, sem retrabalho manual.

  • API NestJS valida CPF, e-mail e telefone
  • Voucher único (~1 bi de combinações) por e-mail via AWS SES
  • Conflitos tratados e documentação Swagger
NestJSAWS SESMySQL
Time multi-repo · 6 devs

−68% de custo de tokens com IA

Rearquitetei o contexto de um time no Claude Code: de 377K para 28K tokens por tarefa, sem perder qualidade.

  • Regra enxuta sempre carregada, profundidade sob demanda
  • Disciplina de arquitetura aplicada a contexto de IA
Claude Codecontextocusto
Frentes autorais

Além da consultoria, três frentes próprias na fronteira técnica. Engenharia de base, não slide.

Engenharia autoral

Engine de jogo própria em C++

Asteroth: mundo isométrico num planeta esférico real, com engine própria desde 2012.

  • Horizonte curvo e geometria de mundo, não skybox falso
  • Pipeline CV + IA: sprite-sheet vira mesh 3D em segundos
C++ECSCV + IA
Repositório público
IA aplicada

Pipelines com MCP, agentes e RAG

IA dentro do produto, com tier por tarefa, não jogada por cima.

  • MCPs para Blender e tooling próprio
  • Agentes orquestrados com LangGraph + pgvector
  • Geração 3D multi-view automatizada
MCPLangGraphpgvector
Skills públicas
Processo

Spec-Driven Development harness

Arquitetura sem processo vira folclore: épico → issue → spec → código, tudo rastreável.

  • Templates e ERD como fonte de verdade
  • Tooling em lote via GitHub CLI, versionado no Git
specstoolinggh
Manifesto técnico
Open source · impacto social

Mapa de hospitais com soro antipeçonhento

Mapa open-source de hospitais com soro antipeçonhento: informação que salva vidas quando cada minuto conta.

  • Acidentes com cobra, escorpião e aranha
  • Aberto e acessível a qualquer pessoa
open sourcemapasaúde
Acessar o app
Projeto autoral · engine própria desde 2012

Asteroth

Um MMORPG isométrico num planeta esférico de verdade: horizonte curvo, sol nascendo e se pondo, duas luas no céu. Um único mundo persistente, gerado de uma seed, onde tudo que existe foi construído por jogadores e pode ser destruído ou pilhado. Explorar → coletar → construir → defender → ser invadido → reconstruir.

44 classes
14 raças
517 itens
98+ bosses

Engine própria em C++ 20: mais de 31 mil linhas, sem Unity nem Unreal. Render OpenGL, gravidade radial, multiplayer com networking da Valve e infra MMO com PostgreSQL + Redis. Pesquisa fundacional concluída em 11 pilares; a engine está na Fase 0 (Fundação 3D).

Conhecer a lore
Autoridade em IA

IA não é feature que se cola por cima: é arquitetura. Escrevo, construo e coloco em produção o que a maioria só demonstra em slide.

Steply · produto

Projeto Atena: IDE de IA

Nossa IDE de IA com observabilidade extrema: IA que trabalha às claras, não caixa-preta.

  • Cada ação rastreável: o que leu, o que decidiu, quanto custou
  • Auditável de ponta a ponta
agentesobservabilidadetooling
Steply · conteúdo

Blog da Steply

Mais de 120 artigos sobre IA aplicada a negócio, escritos para quem decide, não para quem compila.

  • Custo, risco, prazo e previsibilidade
  • Opinião com fundamento, sem hype
IAnegócioPT-BR
Ler o blog
Produção

Agentes, MCP e RAG em produção

Agentes, MCP e RAG rodando em produção, não em slide. A prova está nos deep-dives logo abaixo.

  • Pipelines RAG com rerank e custo por token
  • Orquestração LangGraph e arquitetura de contexto
MCPRAGLangGraph
O desafio

Ler sobre arquitetura de agentes é fácil. Tomar as decisões é que separa quem entendeu de quem concordou. Então: monte uma.

Runbook interativo · 13 etapas

Monte uma arquitetura de agentes para RH que sobrevive à produção

Do .env vazio ao checklist de go-live: você escolhe as ferramentas do agente e vê o runtime recusar o que sobrou, monta a ordem de subida e quebra o smoke test, deixa o dado sensível vazar por um fallback mal configurado, adultera um registro de auditoria e assiste a cadeia de hash romper. Cada etapa é uma decisão sua, com a consequência na tela.

  • Topologia, servidores MCP, tiers de modelo e o gateway de PII
  • Idempotência, outbox, trilha de auditoria e os dois contratos
  • HRIS legado mockado, effective dating e camada anticorrupção
  • CI/CD com LGPD embutida, regra dos 4/5 e mitigação de viés
Aceitar o desafio

Aberto de ponta a ponta, sem cadastro e sem etapa bloqueada. No fim, quem apoiar o material com um café de R$ 19,80 leva um certificado de conclusão nominal, com verificação pública.

  • 13 etapas, cada uma com uma decisão de engenharia
  • 10 simulações rodando no seu navegador, sem servidor
  • 0 LLM chamado: o assunto é o sistema em volta do modelo
Deep-dives técnicos

Perguntas difíceis de arquitetura de IA, respondidas como eu respondo numa sala técnica: direto, opinativo, com o trade-off explícito. Não é teoria de slide.

Arquitetura RAG

Como você arquitetaria um RAG em produção com múltiplos agentes, controle de custo por token e fallback quando o modelo principal cai? Difícil

O funil: recupera muito, reordena, e só o topo real vira token pago no prompt.

Chunk irrelevante é input pago em toda chamada: o rerank é a maior alavanca de custo do sistema inteiro.

  • Híbrido (vetorial + BM25) recupera; o rerank decide o que vira token pago.
  • models como lista ordenada dá fallback na mesma requisição mas o cache morre na troca.
Custo de contexto

Como funciona o prompt caching da Anthropic, e quando ele de fato economiza? Médio

Estável fisicamente antes do volátil. Inverter a ordem não cacheia nada em silêncio.

Caching é prefix match: qualquer byte que muda na posição N invalida tudo que vem depois.

  • Leitura ~0,1×, escrita 1,25×: com TTL de 5 min, duas requisições já pagam.
  • datetime.now() no system é o invalidador que mais aparece e não avisa.
Decisão de abordagem

Diante de um problema novo, como você decide entre prompt engineering, RAG e fine-tuning? Médio

Só sobe de degrau quando o anterior comprovadamente não resolve. Custo e acoplamento sobem junto.

A pergunta não é qual técnica é melhor: é se falta conhecimento ou falta comportamento.

  • Conhecimento → RAG. Comportamento → prompt primeiro, sempre.
  • Fine-tuning quase nunca serve para ensinar fato: serve para estabilizar comportamento.
Saída confiável

Como garantir saída estruturada confiável (ex.: JSON) de um LLM em produção, sem o parser quebrar? Médio / difícil

Três camadas, porque cada uma cobre um modo de falha diferente. Nenhuma sozinha basta.

Confiabilidade vem de restringir a saída na API, não de pedir JSON com educação no prompt.

  • strict: true no tool use garante que o input valida exato.
  • stop_reason: max_tokens devolve JSON truncado: cheque antes de tratar como válido.
Orquestração

Diferença entre orquestração multiagente "de verdade" (LangGraph StateGraph) e só encadear chamadas, e quando a complexidade se paga? Difícil

Cadeia é linha reta. Grafo tem aresta condicional, ciclo e estado inspecionável em qualquer ponto.

Encadeie quando o fluxo é fixo; use grafo quando o próprio fluxo é decisão do modelo.

  • O ciclo pensa → busca → observa não se expressa limpo numa cadeia.
  • Fluxo determinístico com StateGraph é over-engineering: três await bastam.
Arquitetura de contexto

Você cortou ~68% do consumo de tokens num time multi-repo com Claude Code. Como, e por que não degrada a qualidade? Médio / difícil

De 377K para 28K tokens por tarefa, num time de seis. O bloco cheio é a regra slim; os tracejados só carregam quando a tarefa pede.

O gargalo não é o que o modelo gera: é o que fica sempre carregado, multiplicado por toda interação.

  • Regra slim sempre presente; profundidade em skill lida sob demanda.
  • Não removi informação: mudei quando ela entra no contexto.
Observabilidade

Como você instrumenta observabilidade de LLM em produção? O que se mede além de log? Difícil

A chamada de LLM é um span dentro do trace da request, com atributos de domínio pendurados nela.

Log de texto não responde o que importa: quanto custou, por que ficou lento, onde a qualidade caiu.

  • Modelo, versão do prompt, tokens, cache hit/miss, TTFT, stop_reason e custo.
  • Vira alerta só o acionável: custo por tenant, p95 de TTFT, taxa de fallback e de recusa.
Observabilidade · agentes

Observabilidade de agente é diferente da de um chatbot? O que muda quando o modelo decide sozinho? Médio / difícil

A árvore de passos, o custo acumulado e o laço detectado antes de queimar o orçamento.

Chatbot é request/response. Agente é trajetória: a unidade de análise muda de lugar.

  • Detecção de laço: mesma tool com os mesmos argumentos dispara interrupção.
  • Sem replay determinístico, debugar agente é adivinhação com log.
Avaliação

Como medir qualidade de resposta de LLM em produção sem ground truth? Difícil

Do sinal mais barato o usuário aceitou? ao mais caro, o juiz calibrado contra humano.

Sem gabarito, qualidade vem de proxies em camadas nunca de uma métrica só.

  • Golden set é teste de regressão: mudar prompt sem rodar é deploy sem CI.
  • Curva mudando sem deploy seu é informação: quem mexeu foi o provider.
Série didática

Treze páginas interativas em que a conta roda de verdade no seu navegador — nada de animação que finge cálculo. Cada uma defende uma tese só, tem um mecanismo por etapa e um painel dizendo onde o modelo de brinquedo mente. Em PT, EN e ES.

Trilha atual
Espinha principal como um LLM funciona, na ordem Ramo · recuperação como achar o que entra no prompt Ramo · contexto longo quando o prompt não cabe Ramo · execução onde o modelo roda Ramo · agentes quando o modelo vira sistema Trilha paralela outra modalidade
  1. 0 Dentro de um LLM Do token ao próximo token, sem metáfora. A porta de entrada da série. Sem pré-requisito · nível intermediário
  2. 1 Os axiomas operacionais As seis invariantes de quem constrói em cima, e o bug que cada uma explica. Depois de: Dentro de um LLM
  3. 2 Anatomia de um modelo A calculadora de parâmetros e de VRAM, conferida contra os números publicados de GPT-2 a Llama 3 70B. Depois de: Dentro de um LLM
  4. 3 O Transformer por dentro Atenção de verdade sobre o texto que você digitar: Q·K, máscara causal, softmax, quatro cabeças com padrões distintos. Depois de: Anatomia de um modelo
  5. 4 Cache de prompt O prefixo comum medido caractere a caractere, os invalidadores escondidos e a conta de break-even. Depois de: O Transformer por dentro
  6. 5 Fine-tuning, e quando não fazer O custo do LoRA contra o do treino cheio, e o intervalo de confiança que diz se a sua avaliação de 50 exemplos prova alguma coisa. Depois de: Anatomia de um modelo
  7. 6 Embeddings, na prática O vetor que representa o texto, e por que a similaridade acerta e erra. Sem pré-requisito
  8. 7 Grafos: quando o vetor não basta A pergunta de três saltos que o vetor não responde, e o híbrido que resolve. Depois de: Embeddings, na prática
  9. 8 Aprender sobre grafos: GNN Uma rede neural de grafo treinando de verdade no navegador, com backprop escrito na mão. Depois de: Grafos
  10. 9 RLM: o contexto como recurso O dado fica fora da janela, dentro de um REPL. Com o diagrama do artigo refeito em HTML e as duas contas erradas que dividir produz sozinho. Depois de: Os axiomas operacionais
  11. 10 IA local: um modelo grande numa placa pequena O orçamento de memória calculado peso a peso: o que precisa da GPU, o que vira consulta e a curva de RAM que decide a velocidade. Depois de: Anatomia de um modelo
  12. 11 Um agente de verdade: LangChain + LangGraph O passo a passo inteiro: onde criar a conta, o que clicar, a árvore de arquivos, o que escrever em cada um, como testar e quando não usar agente. Depois de: Os axiomas operacionais
  13. 12 Difusão: uma imagem saindo do ruído Cronograma, passo DDIM e CFG rodando de verdade numa grade de 24×24. Independente da espinha de LLM
Hard skills & soft skills

Não é lista de logos: cada skill abaixo vem com o que eu de fato construí com ela.

Linguagens

  • TypeScript e JavaScript há quase uma década: Angular, NestJS e muito Node + Express
  • Java em uso intenso na TOTVS
  • Python com Django em APIs e automação
  • C++ 20 na engine do Asteroth: 31 mil linhas autorais
  • PHP nos primeiros e-commerces; C#/.NET no corporativo
  • SQL com modelagem e ERD como fonte de verdade
TypeScriptJavaPythonC++PHPC#SQL

Front-end

  • Angular de ponta a ponta: Elegance (JET) e quatro temas na Loja Virtuol
  • Liderança do upgrade Angular 9 → 14 com Node 18
  • Svelte e WebRTC na SQUADEVOPS
  • main.js de 26 mil linhas refatorado em módulos
AngularSvelteWebRTC

Back-end & dados

  • APIs Node em produção (NestJS, Express): blog Steply, Mercado Pago e clientes privados
  • PostgreSQL, MySQL e Redis, do schema à infra MMO
  • Migrations versionadas e persistência binária própria
NestJSPostgreSQLRedis

IA & agentes

  • MCPs próprios e corporativos: NetProject, Blender, tooling interno
  • RAG híbrido com rerank e prompt caching
  • LangGraph + pgvector; contexto que cortou 68% do custo
MCPRAGLangGraphpgvector

Infra & processo

  • Azure e integração Zendesk na Supero
  • Docker, PM2 e CI/CD com GitHub Actions
  • Spec-Driven Development rastreável via gh
AzureDockerCI/CD

Soft skills

  • Liderança e mentoria de times como Fractional CTO
  • Comunicação com negócio: meta vira métrica, métrica vira arquitetura
  • Escrita técnica: livro publicado e 120+ artigos
  • Ownership e decisão com trade-off explícito
liderançacomunicaçãoescritaownership
Histórico de desenvolvimento

Mais de 140 projetos de pequeno, médio e grande porte em mais de uma década: legado herdado, produto nascido do zero e urgência de produção. Alguns nomes que sobreviveram na memória:

Brotar Steply Supp Auto News Steply Pitch Steply Services Fashion Manager Comércio dos Comércios OctoGames Sabujo Filmes Workflow Fala → Texto Anime Maker MCP Blender Mapa do Soro Moto Manager Motogator TipzRush Zaya PDV Steply LP Creator GoAnime Recognize Instagram AI LinkedIn AI Leader Assistant Docs Translator Feira Stock Galax API Devil Runner Pirate Bomb Fly by Night Step AI Otimize JobMatch TipTask Adega Share Ideias NG Draw Steply Bot Steply Flow Steply B2B Steply Outbound Container Control Agents Viewer Build Sight Pro + uma centena que a memória não alcança
Capa
Verso

Em 2025 escolhi desacelerar para fortalecer o que sustenta qualquer tecnologia: os fundamentos. Este livro não é sobre frameworks, é sobre como pensar.

  • Big O, patterns e arquitetura aplicados a sistemas reais
  • Decisões com trade-offs conscientes, não modismo
  • IA encarada com maturidade: potencializa quem domina a base
Resultado financeiro nasce de base técnica sólida.

O que trava o crescimento muitas vezes não é marketing: é débito técnico. Arquitetura bem pensada derruba custo, aumenta previsibilidade e transforma tecnologia em alavanca de margem, não em desperdício.