IRONSOFTWAREHOME

Extract Embedded Text and Images from PDFs in C#

Curtis Chau
Curtis Chau
Updated: 16 février 2026

Extrayez à la fois le contenu textuel et les images des documents PDF en C# à l'aide d'appels de méthodes simples. Récupérer le contenu intégré pour l'éditer, l'analyser ou le réutiliser dans d'autres applications.

L'extraction de texte et d'image permet de récupérer le contenu textuel et les éléments graphiques des documents PDF. Accédez au contenu et réutilisez-le pour l'édition, la recherche, la conversion de texte dans d'autres formats ou l'enregistrement d'images en vue de leur réutilisation. Que vous ayez besoin d'parser des PDF en C# pour l'analyse de données, de convertir du contenu dans des formats de recherche ou d'extraire des éléments visuels pour l'archivage, IronPDF fournit des outils d'extraction complets.

Extrayez du texte et des images à l'aide d'IronPDF. Enregistrez les images extraites sur le disque ou convertissez-les dans un autre format avant de les intégrer dans de nouveaux documents. Cette flexibilité prend en charge les flux de travail nécessitant une transformation du contenu, tels que la conversion de PDF en HTML ou la réaffectation d'images extraites.

Démarrage rapide : Extraire du texte et des images avec IronPDF

Extrayez du texte et des images à partir de PDF en quelques lignes de code seulement. Ce quickstart montre comment récupérer du contenu incorporé dans des documents PDF à des fins de réutilisation et d'analyse du contenu. Extrayez du texte pour l'éditer ou enregistrez des images pour une utilisation ultérieure avec la solution rationalisée d'IronPDF.

  1. 1Install IronPDF with NuGet Package Manager

    PM > Install-Package IronPdf

  2. 2Copiez et exécutez cet extrait de code.

    var pdf = new IronPdf.PdfDocument("sample.pdf");  
    string text = pdf.ExtractAllText();  
    var images = pdf.ExtractAllImages();  
    C#
  3. 3Déployez pour tester sur votre environnement de production.

    Commencez à utiliser IronPDF dans votre projet dès aujourd'hui avec un essai gratuit
    arrow pointer

Comment extraire du texte d'un fichier PDF?

Extraire du texte à partir de documents PDF existants ou nouvellement rendus. Utilisez la méthode ExtractAllText pour extraire le texte intégré du document. La méthode renvoie une chaîne contenant tout le texte du PDF. Les pages sont séparées par quatre caractères de retour à la ligne consécutifs. Cet exemple utilise un exemple de PDF rendu à partir du site web de Wikipedia.

Lorsque vous travaillez avec des PDF contenant des langues internationales et des caractères UTF-8, IronPDF conserve un codage et une représentation des caractères corrects. Cela garantit l'affichage correct des scripts non latins et des caractères spéciaux.

using IronPdf;
using System.IO;

PdfDocument pdf = PdfDocument.FromFile("sample.pdf");

// Extract text
string text = pdf.ExtractAllText();

// Export the extracted text to a text file
File.WriteAllText("extractedText.txt", text);
Vue côte à côte de la page Wikipédia et du texte brut extrait, montrant le processus d'extraction de texte

Comment extraire du texte avec des coordonnées précises?

Récupérer les coordonnées des lignes de texte et des caractères dans chaque page PDF. Sélectionnez une page du PDF et accédez aux propriétés Lines et Characters. Les coordonnées comprennent les valeurs Top, Right, Bottom et Left représentant la position du texte. Cette fonction préserve la disposition spatiale et permet l'analyse de la position du texte.

Pour les développeurs qui ont besoin de lire des fichiers PDF en C# avec une conscience de la position, l'extraction de coordonnées fournit des données pour maintenir la structure du document et mettre en œuvre une analyse de texte avancée.

using IronPdf;
using System.IO;
using System.Linq;

// Open PDF from file
PdfDocument pdf = PdfDocument.FromFile("sample.pdf");

// Extract text by lines
var lines = pdf.Pages[0].Lines;

// Extract text by characters
var characters = pdf.Pages[0].Characters;

File.WriteAllLines("lines.txt", lines.Select(l => $"at Y={l.BoundingBox.Bottom:F2}: {l.Contents}"));
Écran partagé montrant la page principale de Wikipédia et le fichier texte extrait avec les coordonnées Y affichant le contenu analysé

Comment extraire des images d'un PDF?

Utilisez la méthode ExtractAllImages pour extraire toutes les images intégrées du document. La méthode renvoie les images sous forme de liste de List d'objets AnyBitmap. À partir du même document, nous avons extrait des images et les avons exportées dans le dossier "images". Cette fonctionnalité prend en charge l'archivage d'images, la migration de contenu et le tramage de pages PDF en images en vue d'un traitement ultérieur.

Les images extraites conservent leur qualité d'origine et peuvent être enregistrées dans différents formats, notamment PNG, JPEG et BMP. Pour les flux de travail de stockage dans le cloud, intégrez cette fonctionnalité avec Azure Blob Storage pour la gestion des images.

using IronPdf;

PdfDocument pdf = PdfDocument.FromFile("sample.pdf");

// Extract images
var images = pdf.ExtractAllImages();

for(int i = 0; i < images.Count; i++)
{
    // Export the extracted images
    images[i].SaveAs($"images/image{i}.png");
}
Explorateur de fichiers affichant 19 images PNG extraites sous forme de vignettes après l'exécution de l'outil d'extraction d'images

Quelles sont les différentes méthodes d'extraction d'images ?

Au-delà de la méthode ExtractAllImages, utilisez les méthodes ExtractAllBitmaps et ExtractAllRawImages pour extraire les informations sur l'image. Alors que ExtractAllBitmaps retourne un List de AnyBitmap, ExtractAllRawImages extrait toutes les images et les retourne sous forme brute byte[] (byte[]).

La méthode ExtractAllRawImages fonctionne bien pour traiter les données d'image en mémoire ou s'intégrer à des systèmes nécessitant des entrées de tableau d'octets. Pour les scénarios impliquant l'exportation de PDF vers des flux de mémoire, le format de tableau d'octets brut offre une flexibilité optimale.


Ma bibliothèque préférée de ce genre est IronPDF. Elle permet une manipulation rapide et efficace des fichiers PDF. Elle dispose également de nombreuses fonctionnalités précieuses, comme l'exportation au format PDF/A et la signature numérique des documents PDF.

Milan Jovanovic

Microsoft MVP

Voir l'étude de cas

IronOCR signifie que nous pouvons économiser 40 000 $ par an grâce au traitement manuel, tout en améliorant la productivité et en libérant des ressources pour des tâches à fort impact. Je le recommande vivement.

Brent Matzelle

Directeur technique, OPYN

Voir l'étude de cas

Iron Suite joue un rôle crucial dans nos opérations. Ce sont des outils qui augmentent l'efficacité de l'entreprise, y compris la création de plans d'étage et l'amélioration de la gestion des stocks.

David Jones

Ingénieur logiciel principal, Agorus Build

Voir l'étude de cas

Comment extraire le contenu de pages PDF spécifiques?

Extraction de texte et d'images à partir d'une ou de plusieurs pages spécifiées. Utilisez les méthodes ExtractTextFromPage et ExtractTextFromPages pour l'extraction de texte d'une ou plusieurs pages. Pour les images, utilisez les méthodes ExtractImagesFromPage et ExtractImagesFromPages.

Ce contrôle granulaire est utile lorsque l'on travaille avec des documents volumineux dont seules des sections spécifiques contiennent un contenu pertinent. Elle prend également en charge les fonctionnalités permettant de séparer les PDF et d'extraire des pages individuelles en vue d'un traitement séparé.

using IronPdf;

PdfDocument pdf = PdfDocument.FromFile("sample.pdf");

// Extract text from page 1
string textFromPage1 = pdf.ExtractTextFromPage(0);

int[] pages = new[] { 0, 2 };

// Extract text from pages 1 & 3
string textFromPage1_3 = pdf.ExtractTextFromPages(pages);

Quand dois-je extraire des pages spécifiques plutôt que toutes les pages?

Extraire des pages spécifiques lorsque :

  • Travailler avec de grands PDF contenant des données pertinentes dans certaines sections
  • Mettre en œuvre des flux de travail qui traitent les pages de manière indépendante
  • Construire des applications nécessitant un affichage ou un traitement de contenu incrémental
  • Optimiser l'utilisation de la mémoire en traitant uniquement les pages requises
  • Création d'une fonctionnalité de recherche ou d'indexation spécifique à une page

Quelles sont les considérations en matière de performances à prendre en compte ?

Tenez compte des facteurs de performance suivants lors de l'extraction de contenu PDF :

  • Utilisation de la mémoire : Extraire des pages individuellement à partir de grands documents pour minimiser la consommation de mémoire
  • Temps de traitement : Utilisez le traitement parallèle pour les extractions de plusieurs pages lorsque cela est approprié
  • Taille du fichier : Les PDF plus grands avec des images en haute résolution nécessitent plus de temps de traitement
  • Stockage : Planifiez un espace disque adéquat pour l'extraction de nombreuses images en haute résolution
  • Threading : IronPDF prend en charge les opérations multi-thread pour une performance améliorée sur les systèmes multi-cœurs

Pour des performances optimales avec les PDF en mémoire, utilisez les opérations de flux en mémoire pour réduire la surcharge d'E/S sur disque.

Questions Fréquemment Posées

Comment extraire du texte de documents PDF en C# ?

Utilisez la méthode ExtractAllText d'IronPDF pour extraire le texte incorporé dans les documents PDF. La méthode renvoie une chaîne contenant tout le texte du PDF, les pages étant séparées par quatre caractères de retour à la ligne consécutifs. IronPDF maintient un encodage correct pour les langues internationales et les caractères UTF-8.

Puis-je extraire des images de fichiers PDF par programmation ?

Oui, IronPDF propose la méthode ExtractAllImages pour extraire les éléments graphiques des documents PDF. Vous pouvez enregistrer les images extraites sur le disque ou les convertir dans d'autres formats avant de les incorporer dans de nouveaux documents.

Quels sont les principaux cas d'utilisation de l'extraction de contenu PDF ?

Les outils d'extraction d'IronPDF prennent en charge divers flux de travail, notamment l'analyse des PDF pour l'analyse des données, la conversion du contenu en formats consultables, l'extraction d'éléments visuels pour l'archivage et la réaffectation du contenu pour l'édition ou la transformation dans d'autres formats tels que HTML.

Combien de lignes de code faut-il pour extraire le contenu d'un PDF ?

Avec IronPDF, vous pouvez extraire du texte et des images en quelques lignes de code seulement. Il vous suffit de charger votre document PDF et d'appeler ExtractAllText() pour l'extraction de texte ou ExtractAllImages() pour l'extraction d'images.

Puis-je extraire le contenu de certaines pages plutôt que du document entier ?

Oui, IronPDF vous permet de spécifier des pages particulières à partir desquelles extraire du texte et des images, ce qui vous donne un contrôle précis sur le contenu à extraire de vos documents PDF.

How can IronPDF assist with extracting text from PDFs containing international languages?

IronPDF maintains proper encoding and character representation for international languages and UTF-8 characters, ensuring correct text extraction and display for non-Latin scripts and special characters.

Is it possible to extract images from a PDF for use in Azure Blob Storage using IronPDF?

Yes, IronPDF's image extraction capabilities are compatible with Azure Blob Storage workflows, allowing you to save extracted images in various formats and manage them effectively in the cloud.

Does IronPDF support extracting text from specific layers within a PDF?

Yes, IronPDF can extract text from specific layers (OCGs) within a PDF using the `ExtractTextFromLayer` and `GetTextObjectsByLayer` methods, which target content grouped in named layers like CAD drawings or map exports.

Curtis Chau
Rédacteur technique

Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.

...
Lire la suite

Prêt à commencer ?

Nuget Downloads 21,105,021Version :2026.9vient de sortir

Obtenez votre GRATUIT

Clé d'essai de 30 jours instantanément.

bullet_checkedAucune carte de crédit ou création de compte requise
bullet_testTester en production
sans filigranes
bullet_calendarProduit entièrement fonctionnel
pendant 30 jours
bullet_supportSupport technique 24/5
pendant l'essai
Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise
Bibliothèque C# NuGet pour PDF
Installer avec NuGet

Version : 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. Dans l'explorateur de solutions, faites un clic droit sur Références, Gestion des packages NuGet
  2. Sélectionnez Parcourir et recherchez « IronPDF »
  3. Sélectionnez le package et installez
C# PDF DLL
Télécharger DLL

Version : 2026.9

ou téléchargez l'installateur Windows ici.

  1. Téléchargez et décompressez IronPDF à un emplacement tel que ~/Libs dans votre répertoire de solution
  2. Dans l'explorateur de solutions Visual Studio, faites un clic droit sur Références. Sélectionnez Parcourir, « IronPDF.dll »

Licences à partir de 749 $

Vous avez une question ? Contactez notre équipe de développement.

Key in blue circle

Obtenez votre clé d'essai de 30 jours instantanément.

Your trial license will be sent to your email address

Aucune restriction. 100 % débloqué. Pas de carte bancaire.

OR
bullet_checkedAucune carte de crédit ou création de compte requiseAucune restriction. 100 % débloqué. Pas de carte bancaire.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
Réservez votre Démonstration en direct gratuite
Booking Badge

De confiance par des millions d'ingénieurs dans le monde entier

Logos des clients d'Iron Software
Obtenez Votre Consultation sans Engagement
Remplissez le formulaire ci-dessous ou envoyez un email à sales@ironsoftware.com
Vos informations seront toujours gardées confidentielles.
De confiance par des millions d'ingénieurs dans le monde entier
Logos des clients d'Iron Software
Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise
Bibliothèque C# NuGet pour PDF
Installer avec NuGet

Version : 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. Dans l'explorateur de solutions, faites un clic droit sur Références, Gestion des packages NuGet
  2. Sélectionnez Parcourir et recherchez « IronPDF »
  3. Sélectionnez le package et installez
C# PDF DLL
Télécharger DLL

Version : 2026.9

ou téléchargez l'installateur Windows ici.

  1. Téléchargez et décompressez IronPDF à un emplacement tel que ~/Libs dans votre répertoire de solution
  2. Dans l'explorateur de solutions Visual Studio, faites un clic droit sur Références. Sélectionnez Parcourir, « IronPDF.dll »

Licences à partir de 749 $