import { describe, expect, it } from "vitest"; import { extractPageMetadata, htmlToMarkdown, htmlToMainText, normalizeCrawlUrl, parseRobots, parseSitemap, robotsAllows, urlPatternMatcher, looksLikePage } from "../src/index"; const PAGE = `Titre & test

Bonjour

Premier paragraphe avec un lien et une image.

Liste

  1. Trois
const x = 1;\nconsole.log(x);
AB
12 | 3

Citation

`; describe("markdown", () => { it("converts the main content to markdown", () => { const md = htmlToMarkdown(PAGE, { baseUrl: "https://site.example/dir/page" }); expect(md).toContain("# Bonjour"); expect(md).toContain("Premier **paragraphe** avec un [lien](https://site.example/lien?utm_source=x#frag) et une ![image](https://site.example/img.png)."); expect(md).toContain("- Un\n- Deux *deux*"); expect(md).toContain("3. Trois"); expect(md).toContain("```js\nconst x = 1;\nconsole.log(x);\n```"); expect(md).toContain("| A | B |\n| --- | --- |\n| 1 | 2 \\| 3 |"); expect(md).toContain("> Citation"); expect(md).not.toContain("Nav A"); expect(md).not.toContain("var a = 1"); }); it("keeps a