Merge pull request #107 from Hestia-Homes/carbon-dev-model

Carbon dev model
add binary to prediction docker, change requiremnets
2026-06-08 11:17:25 +00:00 · 2024-03-28 16:21:52 +00:00 · 2024-03-28 16:06:43 +00:00 · 2024-03-27 23:43:07 +00:00 · 2024-03-27 23:13:29 +00:00 · 2024-03-27 23:10:36 +00:00
27 changed files with 106 additions and 363 deletions
--- a/.dockerignore
+++ b/.dockerignore
@ -1,9 +0,0 @@
 modules/ml-pipeline/src/pipeline/data/predictions
 modules/ml-pipeline/src/pipeline/data/fit_predictions
 modules/ml-pipeline/src/pipeline/data/prepared_data
 modules/ml-pipeline/src/pipeline/data/model/allmodels
 modules/ml-pipeline/src/pipeline/metrics
 modules/ml-pipeline/src/pipeline/__pycache__
 modules/ml-pipeline/src/pipeline/.dvc
 modules/ml-pipeline/src/pipeline/analysis
 modules/ml-pipeline/src/pipeline/metrics
--- a/.github/workflows/Deploy.yml
+++ b/.github/workflows/Deploy.yml
@ -19,8 +19,8 @@ jobs:
      - name: Install Serverless and plugins
        run: |
-          npm install -g serverless@^3.38.0
+          npm install -g serverless
-          npm install -g serverless-domain-manager@^7.3.8
+          npm install -g serverless-domain-manager
      - name: Install DVC
        run: |
--- a/.github/workflows/MLPipelinePullRequest.yml
+++ b/.github/workflows/MLPipelinePullRequest.yml
@ -98,16 +98,6 @@ jobs:
        git fetch --depth=1 origin ${TARGET_BRANCH}:${TARGET_BRANCH}
        dvc metrics diff --md --all ${TARGET_BRANCH} >> report.md
        echo "## Scenario comparison" >> report.md
        cat metrics/scenario_table.md >> report.md
        echo "" >> report.md
        echo "## Scenario metrics" >> report.md
        cat metrics/scenario_metrics.md >> report.md
        cml comment create report.md
        # echo "## Residuals plot from model" >> report.md
--- a/MODEL_REGISTRY.md
+++ b/MODEL_REGISTRY.md
@ -8,25 +8,25 @@
        "active": true
    },
    "sap": {
-        "version": "v0.14.0",
+        "version": "v0.5.0",
        "stage": {
-            "dev": "v0.14.0"
+            "dev": "v0.5.0"
        },
        "registered": true,
        "active": true
    },
    "heat": {
-        "version": "v0.5.0",
+        "version": "v0.4.0",
        "stage": {
-            "dev": "v0.5.0"
+            "dev": "v0.4.0"
        },
        "registered": true,
        "active": true
    },
    "carbon": {
-        "version": "v0.5.0",
+        "version": "v0.4.0",
        "stage": {
-            "dev": "v0.5.0"
+            "dev": "v0.4.0"
        },
        "registered": true,
        "active": true
--- a/deployment/.dockerignore
+++ b/deployment/.dockerignore
@ -1,9 +1,4 @@
-modules/ml-pipeline/src/pipeline/data/predictions
+modules/ml-pipeline/src/pipeline/data/predictions*
-modules/ml-pipeline/src/pipeline/data/fit_predictions
+modules/ml-pipeline/src/pipeline/data/prepared_data*
-modules/ml-pipeline/src/pipeline/data/prepared_data
+modules/ml-pipeline/src/pipeline/data/model/allmodels*
-modules/ml-pipeline/src/pipeline/data/model/allmodels
+modules/ml-pipeline/src/pipeline/metrics*
 modules/ml-pipeline/src/pipeline/metrics
 modules/ml-pipeline/src/__pycache__
 modules/ml-pipeline/src/.dvc
 modules/ml-pipeline/src/analysis
 modules/ml-pipeline/src/metrics
--- a/modules/ml-pipeline/src/.dockerignore
+++ b/modules/ml-pipeline/src/.dockerignore
@ -1,8 +1,4 @@
-pipeline/data/predictions
+pipeline/data/predictions*
-pipeline/data/fit_predictions
+pipeline/data/prepared_data/train.parquet*
-pipeline/data/prepared_data/train.parquet
+pipeline/data/model/allmodels*
-pipeline/data/fit_predictions
+pipeline/metrics*
 pipeline/data/model/allmodels
 pipeline/metrics
 pipeline/.dvc
 pipeline/analysis
--- a/modules/ml-pipeline/src/Prediction.Dockerfile
+++ b/modules/ml-pipeline/src/Prediction.Dockerfile
@ -1,7 +1,7 @@
 # Dockerfile that can be used to test loading a model to generate a prediction (part of CI/CD flow)
 FROM python:3.10.12-slim
-RUN apt-get update && apt-get install -y libgomp1 gcc python3-dev
+RUN apt-get update && apt-get install -y libgomp1
 COPY pipeline/requirements/predictions/requirements.txt requirements.txt
--- a/modules/ml-pipeline/src/README.md
+++ b/modules/ml-pipeline/src/README.md
@ -1,3 +1,3 @@
-# The generic reproducible ML-pipeline
+# The generic reproducible ML-pipeline!
 Pipeline required to build a model to produce an output, that gets hashed via DVC
--- a/modules/ml-pipeline/src/pipeline/.gitignore
+++ b/modules/ml-pipeline/src/pipeline/.gitignore
@ -1,3 +1,4 @@
 # Ignore dynaconf secret files
 .secrets.*
 example.py
--- a/modules/ml-pipeline/src/pipeline/5_generate_scenarios.py
+++ b/modules/ml-pipeline/src/pipeline/5_generate_scenarios.py
@ -1,162 +0,0 @@
 """
 Fourth part of the pipeline:
 After the model is built and metrics are generated,
 we want to test this model against known scenarios
 """
 import os
 import pandas as pd
 from core.interface.InterfaceModels import MLModel
 from core.interface.InterfaceDataClient import DataClient
 from core.interface.InterfaceMetrics import MLMetrics
 from configs.post_prediction_logic import post_prediction_logic
 from core.DataClient import dataclient_factory
 from core.MLModels import model_factory
 from core.MLMetrics import metrics_factory
 from core.Logger import logger
 from config import settings
 logger.info(f"--- Initiate Parameters ---")
 RUNTIME_ENVIRONMENT = os.environ.get("RUNTIME_ENVIRONMENT", "local")
 client_params = settings.client
 prepare_data_params = settings.prepare_data
 build_model_params = settings.build_model
 generate_predictions_params = settings.generate_predictions
 generate_metrics_params = settings.generate_metrics
 feature_process_params = settings.feature_processor
 scenarios_params = settings.scenarios
 model_filepath = build_model_params["model_save_filepath"]
 target = feature_process_params["feature_processor_config"]["target"]
 scenario_data_filepaths = scenarios_params["scenario_data_filepaths"]
 predictions_column_name = generate_predictions_params["predictions_column_name"]
 comparison_output_filepath = scenarios_params["comparison_output_filepath"]
 metrics_output_filepath = scenarios_params["metrics_output_filepath"]
 logger.info(f"--- Initiate MLModel ---")
 model = model_factory(build_model_params["model_type"])
 logger.info(f"--- Initiate DataClient ---")
 # Use data client for input and output, as we use dvc to cache later to the cloud
 input_dataclient_type = scenarios_params["input_dataclient_type"]
 input_dataclient = dataclient_factory(
    dataclient_type=input_dataclient_type,
    dataclient_config=client_params[input_dataclient_type],
 )
 output_dataclient_type = scenarios_params["output_dataclient_type"]
 output_dataclient = dataclient_factory(
    dataclient_type=output_dataclient_type,
    dataclient_config=client_params[output_dataclient_type],
 )
 logger.info(f"--- Initiate MLMetrics ---")
 metrics = metrics_factory(generate_metrics_params["metrics_type"])
 def generate_scenario_predictions(
    input_dataclient: DataClient,
    output_dataclient: DataClient,
    model: MLModel,
    metrics: MLMetrics,
    model_filepath: str,
    scenario_data_filepaths: list,
    predictions_column_name: str,
    comparison_output_filepath: str,
    metrics_output_filepath: str,
 ):
    """
    Given the new model, we generate prediction for expected scenarios
    """
    logger.info("--- Loading Scenario Data ---")
    scenario_data = pd.DataFrame()
    # If we have no scenario data, we can save empty dataframes
    if scenario_data_filepaths is None:
        logger.info("No scenario data filepaths provided")
        output_dataclient.save_data(
            obj=scenario_data, location=comparison_output_filepath, save_config=None
        )
        output_dataclient.save_data(
            obj=scenario_data, location=metrics_output_filepath, save_config=None
        )
        return
    # Can have multiple scenario data files
    for scenario_data_filepath in scenario_data_filepaths:
        scenario_data = pd.concat(
            [
                scenario_data,
                input_dataclient.load_data(scenario_data_filepath, load_config=None),
            ]
        )
    logger.info("--- Loading Model ---")
    model.load_model(model_filepath)
    logger.info("--- Generating Predictions ---")
    predictions = model.predict(
        data=scenario_data, post_prediction_logic=post_prediction_logic
    )
    logger.info("--- Generate Scenario Predicted Impact ---")
    predictions_df = pd.DataFrame(predictions)
    predictions_df.columns = [predictions_column_name]
    scenario_data = pd.concat([scenario_data, predictions_df], axis=1)
    scenario_data["predicted_impact"] = abs(
        scenario_data[predictions_column_name] - scenario_data["sap_starting"]
    )
    logger.info("--- Generate Metrics ---")
    metrics_dict = metrics.generate_metrics(
        scenario_data["impact"], scenario_data["predicted_impact"]
    )
    metrics_df = pd.DataFrame(metrics_dict, index=[0]).T.reset_index()
    metrics_df.columns = ["metric", "value"]
    logger.info("--- Save prediction into metrics ---")
    output_df = scenario_data[["uprn", "id", "impact", "predicted_impact"]]
    output_dataclient.save_data(
        obj=output_df, location=comparison_output_filepath, save_config=None
    )
    output_dataclient.save_data(
        obj=metrics_df, location=metrics_output_filepath, save_config=None
    )
 if __name__ == "__main__":
    logger.info(f"--- {__file__} - Start! ---")
    logger.info(f"--- Generate Scenario Predictions ---")
    generate_scenario_predictions(
        input_dataclient=input_dataclient,
        output_dataclient=output_dataclient,
        model=model,
        metrics=metrics,
        model_filepath=model_filepath,
        scenario_data_filepaths=scenario_data_filepaths,
        predictions_column_name=predictions_column_name,
        comparison_output_filepath=comparison_output_filepath,
        metrics_output_filepath=metrics_output_filepath,
    )
    logger.info(f"--- {__file__} - Complete! ---")
--- a/modules/ml-pipeline/src/pipeline/README.md
+++ b/modules/ml-pipeline/src/pipeline/README.md
@ -37,4 +37,3 @@ Workflow:
    - This experiment will have the corresponding .dvc files for the hashed model and data
 - Use version control as normal
    - git add, git commit etc
 - To revert change, use `git checkout {COMMIT_HASH}`, followed by `git switch -c {NEW_BRANCH_NAME}`
--- a/modules/ml-pipeline/src/pipeline/analysis/feature_importance.parquet
+++ b/modules/ml-pipeline/src/pipeline/analysis/feature_importance.parquet
--- a/modules/ml-pipeline/src/pipeline/config.py
+++ b/modules/ml-pipeline/src/pipeline/config.py
@ -7,7 +7,6 @@ settings = Dynaconf(
        "./configs/settings.yaml",
        "./configs/build_model.yaml",
        "./configs/analysis.yaml",
        "./configs/scenarios.yaml",
    ],
 )
--- a/modules/ml-pipeline/src/pipeline/configs/build_model.yaml
+++ b/modules/ml-pipeline/src/pipeline/configs/build_model.yaml
@ -14,9 +14,9 @@ default:
      output_filepath: ./data/model/allmodels/
      problem_type: regression
      eval_metric: mean_squared_error #mean_absolute_error
-      time_limit: 1800
+      time_limit: 4000
      presets: medium_quality
-      excluded_model_types: ['RF', 'CAT', 'NN_TORCH', 'KNN', 'XT']
+      excluded_model_types: ['RF', 'FASTAI', 'CAT', 'NN_TORCH', 'KNN', 'XT']
      infer_limit: 0.05
      infer_limit_batch_size: 10000
      ag_args_ensemble: {'num_folds_parallel': 2}
--- a/modules/ml-pipeline/src/pipeline/configs/feature_processor_logic.py
+++ b/modules/ml-pipeline/src/pipeline/configs/feature_processor_logic.py
@ -18,30 +18,44 @@ def remove_starting_columns(df):
    return df
-def remove_floor_height_ending(df):
+def keep_negative_heat_change(df):
-    # df.describe(percentiles=[0.005,0.99])['FLOOR_HEIGHT_ENDING']
+    df = df[df["heat_demand_change"] < 0]
    # shows bottom 0.5 percentile is 1.665
    # So keep anything above this
    df = df[df["floor_height_ending"] > 1.665].reset_index(drop=True)
    print("we in here")
    return df
-def remove_minimum_habitable_room_size(df):
+def keep_non_negative_carbon_ending(df):
-    # Need minimum of 6.5m per habitable room
+    df = df[df["carbon_ending"] > 0]
    df = df[
        df["total_floor_area_ending"] / df["number_habitable_rooms"] > 6.5
    ].reset_index(drop=True)
    return df
-def keep_flats(df):
+def keep_negative_carbon_change(df):
-    df = df[df["property_type"] == "Flat"]
+    df = df[df["carbon_change"] < 0]
    return df
-def keep_non_zero_rdsap(df):
+# TODO: Move to ETL pipeline
-    df = df[df["rdsap_change"] != 0]
+def remove_unreasonable_habitable_rooms(df):
    """
    Assumption is that proportion of floor area to habitable rooms should be at least 6.5m2
    """
    minimum_room_size_index = (
        df["total_floor_area_ending"] / df["number_habitable_rooms"] >= 6.5
    )
    df = df[minimum_room_size_index]
    return df
 def remove_top_1_percent_heat_demand(df):
    # threshold_value = df.describe(percentiles=[0.99])['HEAT_DEMAND_STARTING']['99%']
    threshold_value = 860
    df = df[df["heat_demand_starting"] < threshold_value]
    return df
 def remove_top_1_percent_carbon(df):
    # threshold_value = df.describe(percentiles=[0.99])['CARBON_STARTING']['99%']
    threshold_value = 18
    df = df[df["carbon_starting"] < threshold_value]
    return df
@ -54,10 +68,12 @@ def keep_non_zero_rdsap(df):
 #     return df
 business_logic = {
-    # "keep_non_zero_rdsap": keep_non_zero_rdsap,
+    "remove_unreasonable_habitable_rooms": remove_unreasonable_habitable_rooms,
-    # "keep_flats": keep_flats,
+    "keep_negative_heat_change": keep_negative_heat_change,
-    # "remove_minimum_habitable_room_size": remove_minimum_habitable_room_size,
+    "keep_negative_carbon_change": keep_negative_carbon_change,
-    # "remove_floor_height_ending": remove_floor_height_ending
+    "remove_top_1_percent_heat_demand": remove_top_1_percent_heat_demand,
    "remove_top_1_percent_carbon": remove_top_1_percent_carbon,
    "keep_non_negative_carbon_ending": keep_non_negative_carbon_ending,
    # "remove_starting_columns": remove_starting_columns
    # "keep_ENDING_COLUMNS": keep_ending_columns
 }
--- a/modules/ml-pipeline/src/pipeline/configs/post_prediction_logic.py
+++ b/modules/ml-pipeline/src/pipeline/configs/post_prediction_logic.py
@ -1,23 +1,24 @@
 """
 After predictions, we may want to apply some post processing to the predictions
 """
 import pandas as pd
 def clip_predictions_to_minimum_value(
-    data: pd.DataFrame, predictions: pd.Series, minimum_value: int = 0
+    data: pd.DataFrame,
    predictions: pd.Series,
 ) -> pd.Series:
    series_name = predictions.name
    predictions.name = "predictions"
    predictions = predictions.astype(data["carbon_starting"].dtype)
    predictions_df = pd.concat([data, predictions], axis=1)
    # We expect all prediction to be atleast one point improvement
-    replace_index = (
+    replace_index = predictions_df["predictions"] > predictions_df["carbon_starting"]
-        predictions_df["sap_starting"] + minimum_value > predictions_df["predictions"]
+    predictions_df.loc[replace_index, "predictions"] = predictions_df.loc[
-    )
+        replace_index, "carbon_starting"
-    predictions_df.loc[replace_index, "predictions"] = (
+    ]
        predictions_df.loc[replace_index, "sap_starting"] + minimum_value
    )
    predictions_new = predictions_df["predictions"]
    predictions_new.name = series_name
--- a/modules/ml-pipeline/src/pipeline/configs/scenarios.yaml
+++ b/modules/ml-pipeline/src/pipeline/configs/scenarios.yaml
@ -1,13 +0,0 @@
 default:
  scenarios:
    input_dataclient_type: aws-s3
    output_dataclient_type: local
    scenario_data_filepaths:
      # - s3://retrofit-data-dev/scenario_data/22-03-2024-19-20-09/recommendations_scoring_data.parquet
      # - s3://retrofit-data-dev/scenario_data/24-03-2024-20-23-25/recommendations_scoring_data.parquet
      # - s3://retrofit-data-dev/scenario_data/27-03-2024-11-38-15/recommendations_scoring_data.parquet
      # - s3://retrofit-data-dev/scenario_data/26-05-2024-08-47-45/recommendations_scoring_data.parquet
      # - s3://retrofit-data-dev/scenario_data/26-05-2024-10-44-53/recommendations_scoring_data.parquet
      - s3://retrofit-data-dev/scenario_data/28-05-2024-19-22-41/recommendations_scoring_data.parquet
    comparison_output_filepath: ./metrics/scenario_table.md
    metrics_output_filepath: ./metrics/scenario_metrics.md
--- a/modules/ml-pipeline/src/pipeline/configs/settings.yaml
+++ b/modules/ml-pipeline/src/pipeline/configs/settings.yaml
@ -18,10 +18,7 @@ default:
  prepare_data:
    input_dataclient_type: aws-s3
    output_dataclient_type: local
-    # data_filepath: s3://retrofit-data-dev/sap_change_model/2024-03-22-18-56-53/dataset_rooms.parquet
+    data_filepath: s3://retrofit-data-dev/sap_change_model/2024-03-22-18-56-53/dataset_rooms.parquet
    # data_filepath: s3://retrofit-data-dev/sap_change_model/2024-05-25-08-36-36/dataset_rooms.parquet
    # data_filepath: s3://retrofit-data-dev/sap_change_model/2024-05-26-10-31-39/dataset_rooms.parquet
    data_filepath: s3://retrofit-data-dev/sap_change_model/2024-05-28-19-08-25/dataset_rooms.parquet
    train_proportion: 0.9
    output_train_filepath: ./data/prepared_data/train.parquet
    output_test_filepath: ./data/prepared_data/test.parquet
@ -31,37 +28,15 @@ default:
    feature_processor_config:
      subsample_amount: null
      subsample_seed: 0
-      target: sap_ending
+      target: carbon_ending
      identifier_columns: ["uprn"]
-      # drop_columns: ["heat_demand_change", "carbon_change", "rdsap_change", "heat_demand_ending", "carbon_ending", "days_to_starting", "days_to_ending"]
+      # drop_columns: ["heat_demand_change", "carbon_change", "rdsap_change", "heat_demand_ending", "sap_ending"]
      drop_columns: [
-        "heat_demand_change", "carbon_change", "rdsap_change", "heat_demand_ending", "carbon_ending", "days_to_starting", "days_to_ending",
+        "heat_demand_change", "carbon_change", "rdsap_change", "heat_demand_ending", "sap_ending", "days_to_starting", "days_to_ending",
        'number_habitable_rooms_starting', 'number_habitable_rooms_ending', 'number_heated_rooms_starting', 'number_heated_rooms_ending',
        'number_habitable_rooms', 'number_heated_rooms']
      # retain_features: ["SAP_STARTING", "TOTAL_FLOOR_AREA_DIFF"]
      retain_features: null
      # retain_features: ['uprn', 'sap_starting', 'hot_water_energy_eff_ending',
      #  'mainheat_energy_eff_ending', 'constituency', 'roof_energy_eff_ending',
      #  'walls_energy_eff_ending', 'secondheat_description_ending',
      #  'property_type', 'mainheatc_energy_eff_ending', 'built_form',
      #  'walls_insulation_thickness_ending', 'potential_energy_efficiency',
      #  'transaction_type_ending',
      #  'floor_thermal_transmittance_ending',
      #  'low_energy_lighting_ending', 'heat_demand_starting',
      #  'photo_supply_ending', 'carbon_starting',
      #  'walls_thermal_transmittance_ending',
      #  'roof_insulation_thickness_ending',
      #  'total_floor_area_ending', 'number_open_fireplaces_ending',
      #  'windows_energy_eff_ending',
      #  'floor_height_ending',
      #  'extension_count_ending',
      #  'has_air_source_heat_pump_ending',
      #  'charging_system_ending', 'construction_age_band', 'glazed_type_ending',
      #  'roof_thermal_transmittance_ending',
      #  'floor_insulation_thickness_ending', 'has_mains_gas_ending',
      #  'estimated_perimeter_starting', 'energy_consumption_potential',
      #  'environment_impact_potential', 'heater_type_ending',
      #  'multi_glaze_proportion_ending',
      #  'lighting_energy_eff_ending', 'fixed_lighting_outlets_count']
  generate_predictions:
    input_dataclient_type: local
--- a/modules/ml-pipeline/src/pipeline/core/DataClient.py
+++ b/modules/ml-pipeline/src/pipeline/core/DataClient.py
@ -245,8 +245,7 @@ class LocalClient:
        save_methods = {
            ".parquet": self._save_parquet,
-            ".json": self._save_json,
+            ".json": self._save_json
            ".md": self._save_md,
            # "": _save_directory(**save_config),
            # ADD MORE save_methods HERE
        }
@ -295,10 +294,3 @@ class LocalClient:
        # Write the contents of the buffer to the local file
        with open(location, "wb") as f:
            f.write(buffer.getvalue())
    def _save_md(self, obj: pd.DataFrame, location: str, save_config: dict):
        """
        Save object as markdown
        """
        obj.to_markdown(location, **save_config)
--- a/modules/ml-pipeline/src/pipeline/dvc.lock
+++ b/modules/ml-pipeline/src/pipeline/dvc.lock
@ -25,7 +25,7 @@ stages:
        - carbon_change
        - rdsap_change
        - heat_demand_ending
-        - carbon_ending
+        - sap_ending
        - days_to_starting
        - days_to_ending
        - number_habitable_rooms_starting
@ -37,10 +37,10 @@ stages:
        default.feature_processor.feature_processor_config.retain_features:
        default.feature_processor.feature_processor_config.subsample_amount:
        default.feature_processor.feature_processor_config.subsample_seed: 0
-        default.feature_processor.feature_processor_config.target: sap_ending
+        default.feature_processor.feature_processor_config.target: carbon_ending
        default.feature_processor.feature_processor_type: dataframe
        default.prepare_data.data_filepath:
-          s3://retrofit-data-dev/sap_change_model/2024-05-28-19-08-25/dataset_rooms.parquet
+          s3://retrofit-data-dev/sap_change_model/2024-03-22-18-56-53/dataset_rooms.parquet
        default.prepare_data.input_dataclient_type: aws-s3
        default.prepare_data.output_dataclient_type: local
        default.prepare_data.output_test_filepath: ./data/prepared_data/test.parquet
@ -49,8 +49,8 @@ stages:
    outs:
    - path: data/prepared_data/
      hash: md5
-      md5: 80c9e138146a1d96b9d16091c207e2e8.dir
+      md5: 824541f44e6538d2ef10e9d754c79743.dir
-      size: 45056059
+      size: 36691842
      nfiles: 2
  build_model:
    cmd: python 2_build_model.py
@ -61,8 +61,8 @@ stages:
      size: 4820
    - path: data/prepared_data
      hash: md5
-      md5: 80c9e138146a1d96b9d16091c207e2e8.dir
+      md5: 824541f44e6538d2ef10e9d754c79743.dir
-      size: 45056059
+      size: 36691842
      nfiles: 2
    params:
      configs/build_model.yaml:
@ -79,10 +79,11 @@ stages:
              output_filepath: ./data/model/allmodels/
              problem_type: regression
              eval_metric: mean_squared_error
-              time_limit: 1800
+              time_limit: 4000
              presets: medium_quality
              excluded_model_types:
              - RF
              - FASTAI
              - CAT
              - NN_TORCH
              - KNN
@ -94,18 +95,18 @@ stages:
    outs:
    - path: data/fit_predictions/
      hash: md5
-      md5: d9c9afc05e8780db47c0548b19bf7d19.dir
+      md5: 5a3091120d3497fa00b994d91bc7e5eb.dir
-      size: 3349989
+      size: 3664806
      nfiles: 1
    - path: data/model/
      hash: md5
-      md5: 13c3100e1486c27a83a8a47491077842.dir
+      md5: 074da8dcfa515b9f3d082b21c7d76616.dir
-      size: 773523079
+      size: 721558897
-      nfiles: 36
+      nfiles: 31
    - path: metrics/fit_metrics.json
      hash: md5
-      md5: 2ff70a2a45813e1bcdf2ea3aa8e07d4a
+      md5: 728a49dcef5a98182325df455f929a33
-      size: 224
+      size: 225
  generate_predictions:
    cmd: python 3_generate_predictions.py
    deps:
@ -115,13 +116,13 @@ stages:
      size: 2464
    - path: data/model
      hash: md5
-      md5: 13c3100e1486c27a83a8a47491077842.dir
+      md5: 074da8dcfa515b9f3d082b21c7d76616.dir
-      size: 773523079
+      size: 721558897
-      nfiles: 36
+      nfiles: 31
    - path: data/prepared_data
      hash: md5
-      md5: 80c9e138146a1d96b9d16091c207e2e8.dir
+      md5: 824541f44e6538d2ef10e9d754c79743.dir
-      size: 45056059
+      size: 36691842
      nfiles: 2
    params:
      configs/settings.yaml:
@ -133,8 +134,8 @@ stages:
    outs:
    - path: data/predictions/
      hash: md5
-      md5: 5d07bcebf3160a72bb18dfd79106e85c.dir
+      md5: 680f51234d214d4cab9e6a064c75fc5d.dir
-      size: 463197
+      size: 499546
      nfiles: 1
  generate_metrics:
    cmd: python 4_generate_metrics.py
@ -145,13 +146,13 @@ stages:
      size: 3484
    - path: data/predictions
      hash: md5
-      md5: 5d07bcebf3160a72bb18dfd79106e85c.dir
+      md5: 680f51234d214d4cab9e6a064c75fc5d.dir
-      size: 463197
+      size: 499546
      nfiles: 1
    - path: data/prepared_data
      hash: md5
-      md5: 80c9e138146a1d96b9d16091c207e2e8.dir
+      md5: 824541f44e6538d2ef10e9d754c79743.dir
-      size: 45056059
+      size: 36691842
      nfiles: 2
    params:
      configs/settings.yaml:
@ -161,30 +162,5 @@ stages:
    outs:
    - path: metrics/metrics.json
      hash: md5
-      md5: 3e08df02fd5c5d094bcf936e1338d596
+      md5: 67b7ab30a4b0839d20bc6eb0c84e4dd1
-      size: 223
+      size: 226
  generate_scenerio_metrics:
    cmd: python 5_generate_scenarios.py
    deps:
    - path: 5_generate_scenarios.py
      hash: md5
      md5: 40506749fefd926d47c60ff5b16db307
      size: 5337
    params:
      configs/scenarios.yaml:
        default.scenarios:
          input_dataclient_type: aws-s3
          output_dataclient_type: local
          scenario_data_filepaths:
          - s3://retrofit-data-dev/scenario_data/28-05-2024-19-22-41/recommendations_scoring_data.parquet
          comparison_output_filepath: ./metrics/scenario_table.md
          metrics_output_filepath: ./metrics/scenario_metrics.md
    outs:
    - path: metrics/scenario_metrics.md
      hash: md5
      md5: fa4d6d7bbd7818613800da5f8f37ea96
      size: 363
    - path: metrics/scenario_table.md
      hash: md5
      md5: d6baf100a1623cc2467c2f8221d314c9
      size: 2133
--- a/modules/ml-pipeline/src/pipeline/dvc.yaml
+++ b/modules/ml-pipeline/src/pipeline/dvc.yaml
@ -71,17 +71,6 @@ stages:
    outs:
    - metrics/metrics.json
    always_changed: true
  generate_scenerio_metrics:
    cmd: python 5_generate_scenarios.py
    deps:
    - 5_generate_scenarios.py
    params:
    - configs/scenarios.yaml:
      - default.scenarios
    outs:
    - metrics/scenario_table.md
    - metrics/scenario_metrics.md
    always_changed: true
 metrics:
  - metrics/metrics.json
  - metrics/fit_metrics.json
--- a/modules/ml-pipeline/src/pipeline/metrics/.gitignore
+++ b/modules/ml-pipeline/src/pipeline/metrics/.gitignore
@ -1,4 +1,2 @@
 /fit_metrics.json
 /metrics.json
 /scenario_table.md
 /scenario_metrics.md
--- a/modules/ml-pipeline/src/pipeline/requirements/predictions/requirements-dev.txt
+++ b/modules/ml-pipeline/src/pipeline/requirements/predictions/requirements-dev.txt
@ -1,7 +1,7 @@
 joblib==1.3.2
 boto3==1.28.17
 pandas==2.1.4
-autogluon.tabular[all]==1.0.0
+autogluon==1.0.0
 dynaconf==3.2.1
 pyarrow==13.0.0
 pre-commit==3.3.3
--- a/modules/ml-pipeline/src/pipeline/requirements/predictions/requirements.txt
+++ b/modules/ml-pipeline/src/pipeline/requirements/predictions/requirements.txt
@ -1,7 +1,7 @@
 joblib==1.3.2
 boto3==1.28.17
 pandas==2.1.4
-autogluon.tabular[all]==1.0.0
+autogluon==1.0.0
 dynaconf==3.2.1
 pyarrow==13.0.0
 PyYAML==6.0.1
--- a/modules/ml-pipeline/src/pipeline/requirements/training/requirements-dev.txt
+++ b/modules/ml-pipeline/src/pipeline/requirements/training/requirements-dev.txt
@ -1,7 +1,7 @@
 joblib==1.3.2
 boto3==1.28.17
 pandas==2.1.4
-autogluon.tabular[all]==1.0.0
+autogluon==1.0.0
 ray==2.6.3
 dynaconf==3.2.1
 alibi==0.9.5
--- a/modules/ml-pipeline/src/pipeline/requirements/training/requirements.txt
+++ b/modules/ml-pipeline/src/pipeline/requirements/training/requirements.txt
@ -1,4 +1,4 @@
 boto3==1.28.41
 pandas==2.1.4
-autogluon.tabular[all]==1.0.0
+autogluon==1.0.0
 dynaconf==3.2.1
--- a/modules/ml-pipeline/src/pipeline/requirements/version_control/requirements.txt
+++ b/modules/ml-pipeline/src/pipeline/requirements/version_control/requirements.txt
@ -1,4 +1,4 @@
-dvc==3.51.0
+dvc==3.36.0
-dvc-s3==3.2.0
+dvc-s3==3.0.1
-gto==1.7.1
+gto==1.6.1
 pyOpenSSL==23.3.0
Author	SHA1	Message	Date
KhalimCK	c7edb7c611	Merge pull request #107 from Hestia-Homes/carbon-dev-model Carbon dev model	2024-03-28 16:21:52 +00:00
Michael Duong	bb3af26c3f	add binary to prediction docker, change requiremnets	2024-03-28 16:06:43 +00:00
Michael Duong	78bf0a490d	use 0.9 training data	2024-03-27 23:43:07 +00:00
Michael Duong	2da24aa017	run carbon model with new data	2024-03-27 23:13:29 +00:00
Michael Duong	c0dc934be6	run carbon model with new data	2024-03-27 23:10:36 +00:00
Github-Bot	869a276d67	Update Registry	2024-01-30 10:39:26 +00:00
Github-Bot	96765cee05	Update Registry	2024-01-30 10:38:43 +00:00
KhalimCK	f99c0aee2c	Merge pull request #96 from Hestia-Homes/carbon-dev-model Carbon dev model	2024-01-30 10:38:05 +00:00
Michael Duong	76d414417a	Merge branch 'carbon-dev' of github.com:Hestia-Homes/ML into carbon-dev-model	2024-01-30 10:26:43 +00:00
Michael Duong	1887a52230	use new modesl with carbon model	2024-01-30 10:26:28 +00:00
Github-Bot	9880ebed4c	Update Registry	2024-01-18 10:38:17 +00:00
Github-Bot	5d23992d05	Update Registry	2024-01-18 10:37:29 +00:00
KhalimCK	d4836e02cb	Merge pull request #92 from Hestia-Homes/carbon-dev-model Carbon dev model	2024-01-18 10:36:46 +00:00
Michael Duong	9b29e838af	update requirements for dvc	2024-01-17 23:45:07 +00:00
Michael Duong	79a55ba8b5	train 600 second model on new data	2024-01-17 23:35:50 +00:00
Michael Duong	e78a4bb30e	Merge branch 'carbon-dev' of github.com:Hestia-Homes/ML into carbon-dev-model	2024-01-17 23:12:26 +00:00
Michael Duong	ae53499742	add keep only non negative carbon change to carbon model	2023-12-22 09:51:57 +00:00
Github-Bot	db29bece80	Update Registry	2023-11-28 15:27:34 +00:00
Github-Bot	65335468b4	Update Registry	2023-11-28 15:26:50 +00:00
quandanrepo	53afbd26d8	Merge pull request #88 from Hestia-Homes/carbon-dev-model Carbon dev model	2023-11-28 15:26:04 +00:00
Michael Duong	718003b3d9	Merge branch 'carbon-dev' of github.com:Hestia-Homes/ML into carbon-dev-model	2023-11-28 15:14:09 +00:00
Michael Duong	888bfc30c6	Merge branch 'master' of github.com:Hestia-Homes/ML into carbon-dev-model	2023-11-28 15:13:50 +00:00
Michael Duong	2b1e8b912b	restrict dataset	2023-11-28 15:13:42 +00:00
Github-Bot	62f2f83b0a	Update Registry	2023-11-27 19:22:00 +00:00
Github-Bot	03322a13e7	Update Registry	2023-11-27 19:21:22 +00:00
KhalimCK	5f3d9efa92	Merge pull request #85 from Hestia-Homes/carbon-dev-model Carbon dev model	2023-11-27 19:20:40 +00:00
Michael Duong	f29d6af6a2	change readme	2023-11-27 19:13:23 +00:00
Michael Duong	7afc4b06b2	Merge branch 'master' of github.com:Hestia-Homes/ML into carbon-dev-model	2023-11-27 19:12:40 +00:00
Michael Duong	217fb3dca8	add inference speed check	2023-11-27 18:52:47 +00:00
Michael Duong	9a04ffde3b	Merge branch 'master' of github.com:Hestia-Homes/ML into carbon-dev-model	2023-11-27 18:30:10 +00:00
Michael Duong	e6c7b2f58c	Merge branch 'carbon-dev' of github.com:Hestia-Homes/ML into carbon-dev-model	2023-10-12 08:39:24 +00:00
Michael Duong	f2cc32f4b4	using good model 4000s	2023-10-12 08:38:55 +00:00
Github-Bot	2f9092f447	Update Registry	2023-10-11 15:48:52 +00:00
Github-Bot	bb2db16f61	Update Registry	2023-10-11 15:48:04 +00:00
quandanrepo	5aaebd7f44	Merge pull request #71 from Hestia-Homes/carbon-dev-model 400 second model	2023-10-11 16:47:13 +01:00
Michael Duong	680e879503	400 second model	2023-10-11 15:38:55 +00:00
Michael Duong	f4e91162ec	initial model	2023-10-11 13:23:54 +00:00
`@ -1,3 +1,3 @@`
	`# The generic reproducible ML-pipeline`	`# The generic reproducible ML-pipeline!`

	`Pipeline required to build a model to produce an output, that gets hashed via DVC`	`Pipeline required to build a model to produce an output, that gets hashed via DVC`