9. DataSync - CCRGeneticsBranch/oncogenomics GitHub Wiki
Data sync
Description of how Oncogenomics syncs data daily
On Biowulf
- At 23:00 daily, a cron job script /data/khanlab/projects/updatedSync/check_processed_runs.sh is launched to gather all newly processed cases from pipeline.
- The path of project location is defined in /data/khanlab/projects/updatedSync/projects.txt
| Project | Location |
|---|---|
| compass_tso500 | /data/Compass/Analysis/ProcessedResults_NexSeq/OncoPilot/ |
| compass_exome | /data/Compass/Analysis/ProcessedResults_NexSeq/ExomeRNA_Results/ |
| khanlab3 | /data/khanlab3/processed_DATA/ |
| clinomics | /data/khanlab2/ProcessedResults_TGEN/ |
| wulab | /data/Wulab/processed_DATA/ |
| Acc_19 | /data/Acc_19/processed_DATA/ |
| BeatCC | /data/khanlab3/BeatCC/processed_DATA/ |
| processed_DATA | /data/khanlab/projects/processed_DATA/ |
| roper | /data/RoperData/processed_DATA/ |
| alex | /data/AlexanderP3/processed_DATA/ |
| gb | /data/khanlab3/gb_omics/processed_DATA/ |
| k2_data | /data/khanlab3/k2_data_tmp/ |
| khanlab2 | /data/khanlab2/processed_DATA/ |
| NF_benchmarking | /data/khanlab2/NF_benchmarking/results.processed_data/ |
| GBNCI | /data/GBNCI/projects/Sanam_Tumor-normal_processed_data/ |
-
For each project, three files will be generated in /data/khanlab/projects/updatedSync/update_list2:
- new_list_[project name].txt
- today_list_[project name].txt
- yesterday_list_[project name].txt
-
The logic of check_processed_runs.sh:
- Copy today_list.txt to yesterday list.txt
- Save timestamp (with format "Y") of all successful.txt and failed_delete.txt to today_list.txt using stat command
- Save the difference between today_list.txt and yesterday list.txt to new_list.txt
On Frederick server (fsabcl-onc03d)
-
At 2:00 daily, a cron job script "/var/www/html/clinomics/app/scripts/backend/syncProcessedResults.sh all db all" is launched to sync and upload the data to database.
- Sync "new_list.txt" on biowulf (defined in /var/www/html/clinomics/app/scripts/backend/project_mapping.txt) to /var/www/html/onco.data/ProcessedResults/update_list
- For each case, sync data to /var/www/html/onco.data/ProcessedResults/
- Run script /var/www/html/clinomics/app/scripts/backend/deleteCase.pl to delete cases with "failed_delete.txt"
- Run script /var/www/html/clinomics/app/scripts/backend/loadVarPatients.pl to upload cases with "successful.txt" to database
- Run script /var/www/html/clinomics/app/scripts/backend/refreshViews.pl to refresh materialized views on Oracle database
- Run script /var/www/html/clinomics/app/scripts/backend/updateVarCases.pl to determine the case name (defined in master file) for the processed cases
-
At 5:00 daily, a cron job script "/var/www/html/clinomics/app/scripts/backend/syncProcessedResults.sh all bam all" is launched to sync BAM files.
-
At 10:00 daily, a cron job script "/var/www/html/clinomics/app/scripts/backend/syncProcessedResults.sh all tier all" is launched to update variants tiering based on AVIA annotation. (This should be launched after AVIA processing is finished)