Tendergate

Dokumentu parsēšana

Kā augšupielādētie faili tiek pārveidoti par AI lasāmu tekstu.

Kad jūs augšupielādējat PDF vai Word dokumentu, AI nevar to vienkārši "apskatīt" tā, kā to darāt jūs. Tam nepieciešams strukturēts teksts. Parsēšana ir pārveidošanas solis, kas to nodrošina.

Ko parsēšana dara

Kad sākas AI izpildījums, jūsu dokumenti tiek ielādēti izpildījuma sandbox un parsēti tur. Parsēšanas solis:

  1. Iegūst tekstu no dokumenta formāta (PDF, Word, Excel u.c.)
  2. Saglabā struktūru — virsrakstus, rindkopas, sarakstus, tabulas
  3. Apstrādā tabulas — pārvērš tās formātā, ko AI var interpretēt
  4. Izpako arhīvus — izvelk visus failus no EDOC, ASiC-E un .7z arhīviem (tostarp ligzdotiem EDOC) un parsē katru atsevišķi
  5. Nolasa attēlus — transkribē attēlu failus un skenētas lappuses, kurās nav teksta, ko izvilkt

Rezultāts ir tīrs, meklējams teksts, ko AI aģenti var efektīvi lasīt.

Skenētas lappuses un attēli arī tiek nolasīti. Teksta izvilkšana vien no attēla nedod neko, tāpēc otrā piegājienā katrs attēla fails — un katra PDF lappuse, kas izrādās skenējums, nevis digitāls teksts — tiek nosūtīts redzes modelim, kas transkribē redzamo un pievieno šo tekstu parsētajam dokumentam. Zīmogots sertifikāts, parakstīta deklarācija vai specifikācijas tabula, kas pastāv tikai kā attēls, nonāk analīzē ar savu patieso saturu, nevis tiek minēta pēc faila nosaukuma.

Kas ietekmē parsēšanas kvalitāti

Dokumenta tips ir svarīgs. Word dokuments vai natīvs PDF (izveidots no programmatūras, nevis skenēts) dod tīrākos rezultātus. Teksts jau ir digitāls — parsēšana to tikai pārstrukturē.

Skenējumi ir atkarīgi no salasāmības. Tīrs skenējums transkribējas labi. Izplūdis, izbalējis vai stipri sašķiebts var atgriezt maz vai nemaz nolasāma teksta, un tas tiek tā arī fiksēts, nevis izdomāts. Ļoti mazi attēli — logotipi, aizzīmes, izkārtojuma elementi — tiek apzināti izlaisti, un vienam izpildījumam ir noteikts nolasāmo attēlu un skenēto lappušu griesti, tāpēc neparasti attēliem bagāts dokumentu kopums var netikt nolasīts pilnībā. Ja jums ir oriģinālais digitālais dokuments, augšupielādējiet to: tas parsējas ātrāk un precīzāk nekā jebkurš tā skenējums.

Tabulas var būt sarežģītas. Vienkāršas tabulas parsējas labi. PDF tabulas tiek nolasītas pa rindām, un šūna, kas apvienota vairākās rindās, tiek marķēta ar rindām, kuras tā aptver, — tāpēc grupas starpsumma cenu formā netiek sajaukta ar atsevišķas pozīcijas summu. Ligzdotas tabulas un neparasts formatējums joprojām var zaudēt daļu struktūras. Ja svarīga prasība vai cena ir paslēpta sarežģītā tabulā, pārbaudiet parsēšanas rezultātu.

Formatējumam bagāti dokumenti — daudz tekstlodziņu, ūdenszīmju, vairāku kolonnu izkārtojumu — parsēšanas laikā dažkārt var zaudēt saturu. Jo vienkāršāks izkārtojums, jo uzticamāks rezultāts.

Tehnoloģija

Parsēšana notiek sandbox iekšienē, izmantojot atvērtā koda bibliotēkas: PyMuPDF PDF failiem, python-docx modernajiem Word failiem, openpyxl Excel failiem. Mantotos .doc un .xls failus vispirms ar LibreOffice pārveido par mūsdienu Word un Excel failiem un tad nolasa tāpat, tāpēc veca izklājlapas rindu nosaukumi, mērvienības un apraksti saglabājas; ja pārveidošana neizdodas, kā rezerves variantu izmanto vienkāršākus teksta izvilkšanas rīkus (catdoc un xls2csv). Attēlus un skenētas lappuses, kurās šīm bibliotēkām nav teksta slāņa, ko izvilkt, pēc tam transkribē tas pats AI pakalpojumu sniedzējs, ko izmanto pārējais izpildījums. Tā kā darbs notiek jūsu izpildījuma izolētajā sandbox, jūsu dokumentu saturs netiek nosūtīts atsevišķam trešās puses parsēšanas pakalpojumam.

Kad parsēšana neizdodas

Biežākie iemesli ir paroles aizsardzība un faila bojājums. Skatiet BUJ un problēmu novēršana par konkrētām problēmām.

Ja fails atkārtoti neizdodas parsēt, mēģiniet pārveidot avota failu citā formātā un augšupielādēt atkārtoti.

Kā aģenti lasa jūsu dokumentus

Kad sākas analīze vai dokumentu sagatavošana, sistēma izveido izolētu darba vietu (sandbox) konkrētajai izpildei un augšupielādē tajā jūsu oriģinālos dokumentus. Parsēšana notiek sandbox iekšienē, un AI aģents pēc tam lasa failus tieši, izmantojot parastos failu sistēmas rīkus — tieši tāpat, kā to darītu cilvēks ar savu portatīvo datoru:

  • Atver un izlasa konkrētu failu ("izlasi tehnisko piedāvājumu")
  • Meklē pēc atslēgvārda ar ripgrep ("atrast katru ISO 9001 pieminējumu")
  • Saraksta failus mapē
  • Palaiž nelielu komandu rindiņu skaitīšanai, sadaļas izvilkšanai vai formātu pārveidošanai

Iepriekš sagatavotā indeksa nav. Lasīšana notiek pēc pieprasījuma. Aģents pats izlemj, ko apskatīt, atkarībā no tā, ko pārbauda — tieši tāpat kā jūs pārskatītu dokumentu, pārlecot starp sadaļām.

Kad atslēgvārdu meklēšana nepietiek

Lielākajai daļai jautājumu atslēgvārdu meklēšana ir ātrākais veids, kā atrast atbildi — milisekundēs tā atgriež konkrētas rindiņas no konkrētiem failiem. Bet dažreiz ir jāatrod fragmenti pēc nozīmes, nevis precīziem vārdiem.

Iedomājieties, ka nolikums prasa "veselības aprūpes pieredzi". Piegādātāja piedāvājumā varētu būt teikts:

  • "Mēs ieviesām elektroniskās slimību vēstures trīs slimnīcās"
  • "Klīnisko datu pārvaldība Sv. Marijas Medicīnas centram"
  • "Medicīnas nozares projekti veido 60% no mūsu portfeļa"

Nevienā no šīm rindkopām nav precīzi vārdi "veselības aprūpes pieredze", bet visas ir attiecināmas. Kad atslēgvārdu meklēšana neatrod atbildi mīkstam jēdzienam, aģents izmanto semantisko meklēšanu kā rezerves variantu — mazāks AI modelis izlasa attiecīgos failus, sarindo fragmentus pēc nozīmes un atgriež labākos sakritības rezultātus. Tas ir lēnāks un dārgāks par ripgrep, tāpēc aģents to izmanto tikai tad, kad ir nepieciešams.

Kāpēc tas jums ir svarīgi

Divas praktiskas sekas:

  • Parsēšana notiek katrā izpildījumā, sandbox iekšienē. Jūsu oriģināli paliek S3 krātuvē; katrs izpildījums saņem svaigu sandbox, atver tajā oriģinālus un parsē pēc pieprasījuma. Ja parsēšanas kvalitāte konkrētam failam ir slikta, augšupielādējiet faila tīrāku versiju — visi nākamie izpildījumi izmantos jauno versiju.
  • Aģenti lasa kā cilvēki. Viņi nesarakstu atmiņā jūsu dokumentus. Viņi atver failus, meklē vajadzīgo un citē atrasto. Tāpēc katram konstatējumam ir konkrēts pierādījuma citāts — aģents jums rāda tieši to, ko izlasīja.

Šajā lapā