From f3e4e7a46f3fbbc9432d9895678cc0f0b352d199 Mon Sep 17 00:00:00 2001 From: viv3ckj Date: Wed, 10 Jun 2026 12:24:23 +0100 Subject: [PATCH 1/2] Exclude med status == 6, and add to gitignore all things qmd related --- .gitignore | 8 +++++++- .../dataset_definition_med_status_data_development.py | 2 ++ 2 files changed, 9 insertions(+), 1 deletion(-) diff --git a/.gitignore b/.gitignore index f40659f..55cd4e0 100644 --- a/.gitignore +++ b/.gitignore @@ -11,4 +11,10 @@ venv/ .Rproj.user/ released_output/* reports/pharmacy_first_data_development.html -reports/resources/* \ No newline at end of file +reports/resources/* +reports/pharmacy_first_data_development_files/* +pharmacy_first_data_development.* +publish +justfile +reports/_publish_ids.yml +lib/validation/data/df_bsa_validation.csv diff --git a/analysis/dataset_definition_med_status_data_development.py b/analysis/dataset_definition_med_status_data_development.py index e8828d4..9ae9f7f 100644 --- a/analysis/dataset_definition_med_status_data_development.py +++ b/analysis/dataset_definition_med_status_data_development.py @@ -207,6 +207,8 @@ # This will add 6 x 28 = 168 new columns for desc, selected_medications in selected_medications_dict.items(): for status in range(29): + if status == 6: + continue count_med_status_query = selected_medications.where( selected_medications.medication_status.is_in([status]) ).count_for_patient() From a7d6e14539a0f353394e77a2861f431a93e4e9c9 Mon Sep 17 00:00:00 2001 From: viv3ckj Date: Wed, 10 Jun 2026 13:20:27 +0100 Subject: [PATCH 2/2] filter out the med status == 6 --- .../data_development_med_status_post_counts.R | 15 ++++++++------- .../data_development_med_status_pre_counts.R | 19 +++++++++++-------- 2 files changed, 19 insertions(+), 15 deletions(-) diff --git a/analysis/data_development_med_status_post_counts.R b/analysis/data_development_med_status_post_counts.R index 0b35ed6..772545d 100644 --- a/analysis/data_development_med_status_post_counts.R +++ b/analysis/data_development_med_status_post_counts.R @@ -3,18 +3,19 @@ library(arrow) library(dplyr) selected_variables_list <- list( - "post_anymed" <- paste0("post_anymed_", paste0("status", 0:28)), - "post_anypfid" <- paste0("post_anypfid_", paste0("status", 0:28)), - "post_anypfdate" <- paste0("post_anypfdate_", paste0("status", 0:28)), - "post_pfmed" <- paste0("post_pfmed_", paste0("status", 0:28)), - "post_pfmedid" <- paste0("post_pfmedid_", paste0("status", 0:28)), - "post_pfmedpfdate" <- paste0("post_pfmedpfdate_", paste0("status", 0:28)) + post_anymed = paste0("post_anymed_", paste0("status", c(0:5, 7:28))), + post_anypfid = paste0("post_anypfid_", paste0("status", c(0:5, 7:28))), + post_anypfdate = paste0("post_anypfdate_", paste0("status", c(0:5, 7:28))), + post_pfmed = paste0("post_pfmed_", paste0("status", c(0:5, 7:28))), + post_pfmedid = paste0("post_pfmedid_", paste0("status", c(0:5, 7:28))), + post_pfmedpfdate = paste0("post_pfmedpfdate_", paste0("status", c(0:5, 7:28))) ) # Load data df_med_status <- arrow::read_feather( here::here("output", "data_development", "med_status_data_development.arrow") -) %>% select(all_of(unlist(selected_variables_list))) +) %>% + dplyr::select(-dplyr::matches("status6$")) print("Load data successfully") diff --git a/analysis/data_development_med_status_pre_counts.R b/analysis/data_development_med_status_pre_counts.R index d1f82a2..dd170cc 100644 --- a/analysis/data_development_med_status_pre_counts.R +++ b/analysis/data_development_med_status_pre_counts.R @@ -3,23 +3,26 @@ library(arrow) library(dplyr) selected_variables_list <- list( - "pre_anymed" <- paste0("pre_anymed_", paste0("status", 0:28)), - "pre_anypfid" <- paste0("pre_anypfid_", paste0("status", 0:28)), - "pre_anypfdate" <- paste0("pre_anypfdate_", paste0("status", 0:28)), - "pre_pfmed" <- paste0("pre_pfmed_", paste0("status", 0:28)), - "pre_pfmedid" <- paste0("pre_pfmedid_", paste0("status", 0:28)), - "pre_pfmedpfdate" <- paste0("pre_pfmedpfdate_", paste0("status", 0:28)) + pre_anymed = paste0("pre_anymed_", paste0("status", c(0:5, 7:28))), + pre_anypfid = paste0("pre_anypfid_", paste0("status", c(0:5, 7:28))), + pre_anypfdate = paste0("pre_anypfdate_", paste0("status", c(0:5, 7:28))), + pre_pfmed = paste0("pre_pfmed_", paste0("status", c(0:5, 7:28))), + pre_pfmedid = paste0("pre_pfmedid_", paste0("status", c(0:5, 7:28))), + pre_pfmedpfdate = paste0("pre_pfmedpfdate_", paste0("status", c(0:5, 7:28))) ) # Load data +expected <- unlist(selected_variables_list) + df_med_status <- arrow::read_feather( here::here("output", "data_development", "med_status_data_development.arrow") -) %>% select(all_of(unlist(selected_variables_list))) +) %>% + dplyr::select(-dplyr::matches("status6$")) print("Load data successfully") # Check that all names defined in data_extractions are in df df_med_status -# all(unlist(selected_variables_list) %in% names(df_med_status)) +#all(unlist(selected_variables_list) %in% names(df_med_status)) print("Define variable names successfully")