PDF Vector

PDF Vector

« PDF Vector convertit tout document en données structurées prêtes à l'emploi pour les systèmes d'IA. »

BootstrappedBuild in Public

En une phrase

PDF Vector est une interface de programmation applicative (API) qui transforme des documents (PDF, Word, images, factures, relevés bancaires) en données structurées ou en Markdown propre, pour les développeurs qui construisent des systèmes d'IA. Elle est fondée en juin 2025 par Minh-Phuc Tran, depuis Hô Chi Minh-Ville au Vietnam. Les premiers clients valident le produit rapidement. Cela permet à Tran d'ajouter des intégrations no-code comme n8n, Zapier et Make, puis un serveur MCP compatible avec des outils AI comme Claude Desktop. PDF Vector atteint 1 k $ MRR en 4 mois puis 2 k $ MRR 2 mois plus tard, en restant entièrement Bootstrapped.

LlamaParse

Service de parsing de documents par IA qui convertit tableaux, graphiques et manuscrits en Markdown structuré pour les applications de grands modèles de langage (LLM). Il supporte plus de 90 formats de fichiers et plus de 100 langues. Les tarifs vont de 0 $ par mois pour 10 k crédits à 500 $ par mois pour 400 k crédits. LlamaParse est nativement intégré à l'écosystème LlamaIndex, ce qui le rend plus puissant pour les pipelines de récupération augmentée par génération (RAG) avancés. En revanche, il ne propose pas de recherche académique multi-bases ni d'extraction structurée sur des champs personnalisés pour les factures ou les pièces d'identité.

Unstructured

Bibliothèque Open Source et API cloud pour ingérer et prétraiter des documents (PDF, Office, images) en éléments structurés destinés aux pipelines d'IA générative. Elle propose des connecteurs préconstruits pour des sources de données comme S3, GitHub ou Google Cloud Storage. La tarification est à la page, autour de 0,03 $ par page, sans crédits mensuels fixes. Unstructured offre un niveau de personnalisation et de contrôle supérieur à PDF Vector grâce à sa version open source. En revanche, elle ne propose pas de fonction de questions-réponses en langage naturel intégrée, ni de recherche académique multi-bases.

Docparser

Outil d'extraction de données basé sur des règles et des modèles visuels, conçu pour traiter des PDF, des factures et des formulaires répétitifs. Il cible principalement l'automatisation des flux documentaires en entreprise et s'intègre à Zapier. Les tarifs démarrent autour de 39 $ par mois. Docparser est plus fiable que PDF Vector sur des documents très standardisés grâce à ses règles précises, sans coût lié à l'IA. En revanche, il ne s'adapte pas aux layouts variables ou complexes sans reconfiguration manuelle et ne propose aucune conversion Markdown ni recherche académique.

2 k $ MRRAtteint le 5 décembre 2025, soit moins de 6 mois après le lancement du produit.
1 k $ MRR en 4 moisPremier seuil atteint le 15 octobre 2025, sans investisseur ni publicité payante.
5 M papiers académiquesIndexés via PubMed, ArXiv, Semantic Scholar, Google Scholar, Europe PMC et OpenAlex.
  1. ArrFounder - Pdfvector Passes $1K MRR
    https://arrfounder.com/news/pdfvector-passes-1k-mrr
  2. PDF Vector Blog - PDF Vector API Review: What Actually Works in Prod
    https://www.pdfvector.com/blog/pdf-vector-api-review
  3. n8n Community - I automated contract review with AI + Google Drive
    https://community.n8n.io/t/i-automated-contract-review-with-ai-google-drive-flags-risky-clauses-and-sends-a-slack-summary-before-anyone-opens-the-file/273980
  4. n8n Community - Build a Meeting Action Item Extractor with n8n + Google Drive
    https://community.n8n.io/t/build-a-meeting-action-item-extractor-with-n8n-google-drive-slack/276775
  5. Indie Hackers - Quit my job the 2nd time, here's how I'm doing it differently this time
    https://www.indiehackers.com/post/quit-my-job-the-2nd-time-heres-how-i-m-doing-it-differently-this-time-67d01898fa
  6. Steemit - PDF Vector - Perfect for AI apps, research tools, and automation workflow
    https://steemit.com/steemhunt/@maskutkukni/pdf-vector-perfect-for-ai-apps-research-tools-and-automation-workflow