Sprawdzenie, ile stron znajduje się w jednym pliku PDF, jest banalne. Przeglądarka wyświetla liczbę stron. Dowiedzenie się, ile stron znajduje się w 50 plikach PDF w folderze lub ile słów znajduje się w każdym z nich, nie jest już takie proste. Ręczne otwieranie każdego pliku, zapisywanie liczby i sumowanie liczb zajmuje więcej czasu niż rzeczywista praca, do której stworzono pliki PDF.
Ręczne liczenie plików to zadanie, do którego wykonania wymyślono komputery. Jednak większość narzędzi PDF nie oferuje zliczania wielu plików.
Zliczanie słów i stron w wielu plikach PDF Batch wymaga albo narzędzia obsługującego statystyki wsadowe, albo skryptu, który wyodrębnia informacje z każdego pliku i sumuje je. Narzędzia PDF Pages WukongPDF mogą pomóc w tworzeniu statystyk poszczególnych plików, a poniższe metody obsługują agregację wielu plików.

Korzystanie z wbudowanych statystyk wsadowych w narzędziach PDF
Program Adobe Acrobat Pro nie zawiera strony wsadowej ani funkcji liczenia słów. Niektóre narzędzia do zarządzania plikami PDF innych firm tak robią. PDF Architect i Nitro Pro zawierają moduły przetwarzania wsadowego, które mogą raportować liczbę stron w wybranym zestawie plików. Dane wyjściowe to zazwyczaj plik CSV zawierający listę nazw plików i liczby stron, a suma znajduje się na dole.
Narzędzia PDF oparte na przeglądarce zazwyczaj nie oferują statystyk dotyczących wielu plików, ponieważ model żądań bezstanowych nie przechowuje informacji podczas przesyłania plików. Każdy plik to osobna sesja. Agregowanie statystyk wymaga trwałej sesji obejmującej wiele plików, co jest bardziej powszechne w narzędziach komputerowych i serwerowych.
Spróbuj scalić pliki PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Korzystanie z Eksploratora plików do szacowania liczby stron
Eksplorator plików systemu Windows i narzędzie macOS Finder wyświetlają liczbę stron plików PDF w kolumnach metadanych plików. Włącz kolumnę Strony w widoku szczegółów Eksploratora plików, a na liście pojawi się liczba stron dla każdego pliku PDF. Wybierz wszystkie pliki, a na pasku stanu może zostać wyświetlona suma, w zależności od wersji i konfiguracji systemu operacyjnego.
Odczyt liczby stron w Eksploratorze plików jest szybki, ponieważ odczytuje małe pole metadanych w każdym pliku PDF zamiast otwierać cały plik. W przypadku folderu zawierającego setki plików PDF liczba stron jest wyświetlana w ciągu kilku sekund. Jednak Eksplorator plików nie podaje liczby słów, a odczyt liczby stron może być niedokładny w przypadku plików PDF o niestandardowych strukturach wewnętrznych, w których metadane nie zgadzają się z rzeczywistą liczbą stron.
Skryptowanie liczby słów i stron w plikach PDF
Python z biblioteką PDF, taką jak PyPDF2 lub pdfplumber, może wyodrębnić liczbę stron i słów z każdego pliku PDF w folderze i zsumować je. Skrypt otwiera każdy plik PDF, odczytuje liczbę stron z metadanych dokumentu, wyodrębnia tekst z każdej strony, liczy słowa i gromadzi sumy. Dane wyjściowe to łączna liczba stron i słów w całym folderze.
Skrypt obsługuje dowolną liczbę plików. Folder zawierający 500 plików PDF jest przetwarzany w ciągu kilku minut, w zależności od rozmiaru pliku i szybkości wyodrębniania tekstu. Skrypt generuje spójne wyniki, ponieważ stosuje tę samą logikę zliczania do każdego pliku. Ręczne liczenie wprowadza różnicę wynikającą ze zmęczenia i rozproszenia uwagi. Liczenie skryptowe jest powtarzalne i podlega kontroli.
| Metoda | Prędkość | Dokładność | Podaje liczbę słów? |
|---|---|---|---|
| Metadane Eksploratora plików | Towary drugiej jakości | Umiarkowany (tylko metadane) | NIE |
| Narzędzie wsadowe PDF | Protokół | Wysoki | Niektóre narzędzia |
| Skrypt Pythona | Minuty (w zależności od liczby plików) | Wysoki (wyodrębnia rzeczywisty tekst) | Tak |
| Ręczne otwieranie i liczenie | Godziny | Niski (zmęczenie) | Tak, ręcznie |
Obsługa zeskanowanych plików PDF w trybie zliczania słów
Zeskanowane pliki PDF zawierają obrazy, a nie tekst. Liczenie słów oparte na wyodrębnianiu tekstu zwraca zero słów w zeskanowanym dokumencie, ponieważ nie ma tekstu do wyodrębnienia. Aby uwzględnić zeskanowane pliki PDF w liczbie słów, najpierw uruchom na nich OCR w celu utworzenia warstwy tekstowej. Następnie skrypt zliczający słowa zlicza tekst OCR. Liczba słów OCR jest przybliżona, ponieważ OCR wprowadza błędy rozpoznawania.
W przypadku folderów mieszanych zawierających zarówno cyfrowe, jak i zeskanowane pliki PDF, skrypt powinien raportować oddzielne sumy: słowa z cyfrowych plików PDF z tekstem natywnym i słowa z zeskanowanych plików PDF po OCR. Łączenie ich w jedną sumę bez rozróżniania źródeł zawyża dokładność liczby słów w zeskanowanym dokumencie i zaciemnia fakt, że część sumy jest szacowana przez OCR, a nie dokładna.
Eksportowanie liczby słów według sekcji lub rozdziałów
Oprócz całkowitej liczby słów wyodrębnianie liczby słów w sekcji każdego pliku PDF zapewnia szczegółowe dane do edycji, tłumaczenia i rozliczeń. Skrypt wykorzystujący zakładki PDF lub wykrywanie nagłówków do segmentowania tekstu i liczenia słów w segmencie tworzy szczegółowy raport. Każdy wiersz danych wyjściowych zawiera nazwę pliku, nazwę sekcji i liczbę słów w tej sekcji.
Liczenie na poziomie sekcji jest przydatne w przypadku projektów tłumaczeniowych, w których różne sekcje są przypisane różnym tłumaczom. Kierownik projektu wykorzystuje liczniki do równomiernego rozłożenia pracy i oszacowania czasu ukończenia. Te same liczby dotyczą rozliczania według sekcji, gdzie ceny różnią się w zależności od złożoności treści. Całkowita liczba słów informuje o wielkości projektu. Liczba słów na poziomie sekcji informuje, jak je podzielić.
Używanie licznika do fakturowania i szacowania
Freelancerzy i agencje rozliczające się według strony lub słowa używają liczników partii do generowania faktur. Skrypt generujący plik CSV zawierający nazwy plików, liczbę stron i liczbę słów zapewnia raport gotowy do rozliczeń. Klient może samodzielnie zweryfikować liczniki. Raport wspiera fakturę danymi.
Szacowanie projektu jest również korzystne ze względu na liczenie partii. Projekt tłumaczeniowy wyceniany za słowo wymaga dokładnej liczby słów źródłowych we wszystkich dokumentach. Projekt drukowania wyceniony na stronę wymaga całkowitej liczby stron. Przeliczenie przed wyceną gwarantuje, że wycena opiera się na rzeczywistej liczbie dokumentów, a nie na szacunkach. Czas poświęcony na liczenie procentuje w postaci dokładnej wyceny.
Spróbuj scalić pliki PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
