दो PDF की तुलना करें

दो PDF डालें, उनकी टेक्स्ट कंटेंट लाइन दर लाइन तुलना होते हुए देखें, जोड़े और हटाए गए हिस्से हाइलाइट किए हुए.

ओरिजिनल PDF चुनने के लिए क्लिक करें या इसे खींचकर लाएं

बदली हुई PDF चुनने के लिए क्लिक करें या इसे खींचकर लाएं

तुलना देखने के लिए दोनों PDF डालें.

यह कैसे काम करता है

हर PDF को pdf.js से पढ़ा जाता है, वही इंजन जो Firefox PDF रेंडर करने के लिए इस्तेमाल करता है, जो हर पेज की कंटेंट स्ट्रीम में जाकर getTextContent() के ज़रिए उसकी एम्बेडेड टेक्स्ट इकट्ठा करता है. फिर दोनों टेक्स्ट को लाइनों में बांटकर उसी longest-common-subsequence डिफ एल्गोरिदम से गुज़ारा जाता है जो norito के टेक्स्ट डिफ चेकर टूल के पीछे काम करता है, जो लाइन जोड़ने और हटाने का सबसे छोटा सेट ढूंढ़ता है जो दोनों डॉक्यूमेंट के फ़र्क़ को समझाए, न कि सीधे लाइन-दर-लाइन पोज़िशन की तुलना करे (जो एक पैराग्राफ़ जुड़ने भर से हर लाइन को बदला हुआ दिखा देगी).

किसी भी PDF टेक्स्ट एक्सट्रैक्शन की तरह, नतीजे इस बात पर निर्भर करते हैं कि PDF में वाकई टेक्स्ट मौजूद है. स्कैन किए गए पेज इमेज होते हैं और तुलना में कुछ योगदान नहीं देते. सब कुछ, एक्सट्रैक्शन और डिफिंग दोनों, इसी ब्राउज़र टैब में होता है; कोई भी फ़ाइल अपलोड नहीं होती.

सामान्य प्रश्न

क्या यह लेआउट/डिज़ाइन की तुलना करता है या सिर्फ़ टेक्स्ट की?

सिर्फ़ टेक्स्ट कंटेंट की. यह हर PDF की एम्बेडेड टेक्स्ट निकालकर उसकी डिफ बनाता है, इसलिए यह शब्दों में बदलाव, जोड़े/हटाए गए पैराग्राफ़ और बदले गए नंबर पकड़ लेता है, लेकिन सिर्फ़ विज़ुअल बदलाव जैसे फ़ॉन्ट बदलना या एक जैसे आसपास के टेक्स्ट के साथ इमेज खिसकना, नहीं पकड़ता.

क्या यह स्कैन की गई PDF पर काम करेगा?

नहीं, स्कैन किए गए पेज इमेज होते हैं जिनमें कोई एम्बेडेड टेक्स्ट नहीं होता, इसलिए निकालने या तुलना करने के लिए कुछ नहीं होता, जब तक कि PDF पहले से OCR से न गुज़री हो.

क्या मेरी PDF कहीं अपलोड होती हैं?

नहीं. दोनों फ़ाइलें पूरी तरह आपके ब्राउज़र में पढ़ी और तुलना की जाती हैं. कुछ भी अपलोड नहीं होता, जो उन कॉन्ट्रैक्ट या ड्राफ़्ट के लिए अहम है जिनकी आप तुलना कर रहे हैं.