# Trouve-KA — extraction de contenu # Author: Simon-Pierre Boucher # Contact: contact@spboucher.ai """Extraction de contenu des pages crawlées (CLAUDE.md §6). Chaque page est traitée comme non fiable : texte extrait puis assaini, URLs re-canonicalisées, MIME types jamais crus sur parole. """ from .html_parser import parse_html, decode_html, looks_like_garbage __all__ = ["parse_html", "decode_html", "looks_like_garbage"]