import os from pdfReader.pdfReaderToText import pdfReaderToText from etl.scraper.scraper import SharePointScraper, SharePointInstaller from pprint import pprint, pformat import logging from etl.utils.logger import Logger from etl.validator.validator import DomnaSharePointValidator logger = Logger(name="main.py", level=logging.DEBUG).get_logger() DATA_LOC_1 = "/tmp/sharepoint/Abdul Koddus/W.C. 03.03.2025/Southern Housing/10 Turnberry Close TN38 0WL/PRE SITE NOTES.pdf" DATA_LOC_2 = "/tmp/sharepoint/Abdul Koddus/W.C. 03.03.2025/Southern Housing/16 Sunningdale Drive TN38 0WB/PRE SITE NOTES.pdf" # Extract and trasform pdfReader = pdfReaderToText(DATA_LOC_1) doc2 = pdfReader.get_reader() pdfReader2 = pdfReaderToText(DATA_LOC_2) doc1 = pdfReader2.get_reader() print(doc1.survey_information) # Transform def main(): # south_coast_scraper = SharePointScraper(SharePointInstaller.SOUTH_COAST_INSULATION_SERVICE, development = True) # south_coast_scraper.download_file_for_each_address() pass if __name__ == "__main__": main() # Current todo list # - [x] Finish off scraping for section that I need to finish # - [] Pydantic format for deemed report # - [] Generate deemed report # - [] Docker compose to an sql database in docker compose (2 hours, then work on sql) # - [] Deploy via terraform to aws (1 day)