Devs & IA
/defuddleProgramação

Extrair o conteúdo limpo de uma página web

Converte uma página cheia de menu, banner e rodapé em Markdown só com o texto que interessa — e com uma fração dos tokens.

Para: Quem alimenta IA com conteúdo da web

O que é

Uma página de documentação típica tem 90% de coisa que não é o conteúdo: navegação, barra lateral, rodapé, aviso de cookie, links relacionados, scripts. Quando você joga isso inteiro num modelo, paga por tudo — e piora a resposta, porque o ruído compete com o sinal.

Esta skill roda a extração e devolve Markdown limpo. O ganho é duplo e mensurável: menos tokens (custo) e contexto mais denso (qualidade). É das poucas otimizações em que os dois melhoram juntos.

Quando usar

  • Antes de mandar documentação de biblioteca para o modelo ler
  • Ao montar base de conhecimento a partir de páginas web
  • Quando o modelo está respondendo de forma genérica apesar de você ter dado a página inteira — provavelmente ele se perdeu no ruído
  • Em qualquer fluxo automatizado que consome conteúdo da web repetidamente

Quando não usar

  • Quando o layout faz parte da informação — comparar design, auditar acessibilidade, analisar UI
  • Em página cujo conteúdo é gerado por JavaScript depois do carregamento, dependendo do caso
  • Para uma leitura pontual de uma página só: copiar e colar resolve

O erro mais comum

Confiar na extração sem conferir uma vez. Sites com estrutura incomum às vezes perdem justamente o trecho importante — uma tabela de parâmetros, um bloco de código dentro de aba. Na primeira vez que processar um domínio novo, olhe o resultado. Depois disso, pode automatizar.

Instalação

$ npx skills add anthropics/skills
Ver o repositório de origem ↗

Outras skills de Programação