חילוץ הטקסט מתוך קובץ PDF
מוציאים את הטקסט מהמסמך לקובץ TXT פשוט שאפשר לחפש בו, להדביק ממנו או להזין אותו למקום אחר. מגבלה אחת הוגנת מראש: הכלי קורא טקסט שכבר קיים בקובץ ואינו מריץ OCR על סריקות.
ללא חשבון. ללא מגבלות גודל קובץ מצד השרת. עובד גם לא מקוון לאחר הטעינה.
מקובץ PDF לקובץ טקסט פשוט

גוררים פנימה את המסמך
העמודים מוצגים כדי שתוכלו לוודא שטענתם את הקובץ הנכון לפני שמוציאים ממנו משהו.

משאירים רק את העמודים שצריך מהם טקסט
מוחקים את השאר, והפלט נשאר ממוקד במקום להגיע כקיר טקסט אחד מהשער ועד הנספח.

מייצאים קובץ TXT
הטקסט נכתב לפי סדר העמודים כטקסט פשוט. פריסה, טבלאות וטורים אינם משוחזרים – אלה המילים, לא העיצוב.
מה הכלי הזה עושה ומה הוא לא עושה
טקסט פשוט, מוכן להדבקה
קובץ TXT בלי תגיות ובלי עיצוב, וזה בדיוק מה שצריך כדי לחפש, לצטט או להזין לתוכנה אחרת.
אמירה ברורה על סריקות, לא התחמקות
אין כאן OCR. עמוד שהוא תמונה בלבד לא יניב כלום – ואתם מקבלים בדיוק אילו עמודים חזרו ריקים, במקום קובץ קצר בלי הסבר.
בוחרים את העמודים קודם
מוחקים את העמודים שלא צריך לפני הייצוא, וקובץ ה-TXT מכיל את הפרק שחיפשתם ולא את כל המסמך.
מסמכים חסויים נשארים במקום
חילוץ טקסט מופעל בדרך כלל על משהו שמנתחים – חוזה, דוח, דף חשבון. שום דבר מזה לא מועלה לשום מקום.
חילוץ טקסט מקובץ PDF – שאלות שחוזרות
למה קובץ ה-PDF הסרוק שלי הפיק קובץ ריק?
כי סריקה היא תמונה של עמוד, לא טקסט. החילוץ קורא את שכבת הטקסט שקובץ PDF נושא, ולעמוד סרוק או מצולם אין כזאת. זיהוי אותיות בתוך תמונה הוא OCR, והכלי הזה במכוון אינו עושה זאת – הוא מדווח על העמודים האלה כריקים במקום לנחש.
איך אני יודע אם יש בקובץ שלי טקסט אמיתי?
פתחו אותו בכל תוכנת קריאה ונסו לסמן שורה עם הסמן. אם הטקסט מודגש, הוא ייחלץ. אם אתם מקבלים רק מלבן בחירה מעל תמונה, אין שם מה להוציא.
פריסת המסמך נשמרת?
לא. הפלט הוא טקסט פשוט לפי סדר העמודים. פריסות מרובות טורים, טבלאות וכותרות יוצאות כשורות רצופות, מה שעלול להיקרא בסדר משונה בעמוד עם פריסה מורכבת.
אפשר לחלץ טקסט רק מחלק מהמסמך?
כן – מחקו את העמודים שלא רוצים לפני הייצוא. אין בחירה בתוך עמוד, ולכן היחידה הקטנה ביותר היא עמוד שלם.
ליגטורות ותווים עם ניקוד או סימנים מטופלים נכון?
בדרך כלל כן. הטקסט יוצא כפי שהקובץ קידד אותו, ולכן קובצי PDF שנעשו כהלכה נחלצים נקי. מסמכים שיוצרו בכלים ישנים עם קידודי גופן שבורים עלולים להניב תווים מוזרים, ואף מחלץ לא יכול לתקן זאת בדיעבד.
המסמך שלי מועלה כדי לחלץ ממנו טקסט?
לא. pdf.js קורא את שכבת הטקסט בתוך הדפדפן שלכם וכותב שם את קובץ ה-TXT. שום דבר לא נשלח לשום מקום, וזה משנה במיוחד כשמדובר במסמכים ששווה לנתח.