import { describe, expect, it } from "vitest";
import { extractPageMetadata, htmlToMarkdown, htmlToMainText, normalizeCrawlUrl, parseRobots, parseSitemap, robotsAllows, urlPatternMatcher, looksLikePage } from "../src/index";
const PAGE = `
Titre & test
Bonjour
Premier paragraphe avec un lien et une
.
Liste
- Trois
const x = 1;\nconsole.log(x);
Citation
`;
describe("markdown", () => {
it("converts the main content to markdown", () => {
const md = htmlToMarkdown(PAGE, { baseUrl: "https://site.example/dir/page" });
expect(md).toContain("# Bonjour");
expect(md).toContain("Premier **paragraphe** avec un [lien](https://site.example/lien?utm_source=x#frag) et une .");
expect(md).toContain("- Un\n- Deux *deux*");
expect(md).toContain("3. Trois");
expect(md).toContain("```js\nconst x = 1;\nconsole.log(x);\n```");
expect(md).toContain("| A | B |\n| --- | --- |\n| 1 | 2 \\| 3 |");
expect(md).toContain("> Citation");
expect(md).not.toContain("Nav A");
expect(md).not.toContain("var a = 1");
});
it("keeps a