یک رویکرد یادگیری انتقالی از طریق تحلیل پروکروستس و تغییر میانگین برای پیش بینی حساسیت داروی سرطان

Article: A transfer learning approach via Procrustes analysis and mean shift for cancer drug sensitivity prediction

Journal: Journal of Bioinformatics and Computational Biology

Authors: Turki Turki, Zhi Wei, and Jason T. L. Wang

Affiliation: Department of Computer Science, King Abdulaziz University, Saudi Arabia

                    Department of Computer Science, New Jersey Institute of Technology Newark, USA

Year: 2018

Citations: 19

Link: worldscientific.com/doi/abs/10.1142/S0219720018400140

 

چکیده:

الگوریتم‌های یادگیری انتقالی (Transfer Learning) قصد دارد عملکرد پیش‌بینی در یک کار هدف (به عنوان مثال پیش‌بینی حساسیت سیس‌پلاتین در بیماران سرطان پستان سه‌گانه-منفی)را از طریق انتقال دانش از داده‌های کمکی یک کار مربوطه (به عنوان مثال پیش‌بینی حساسیت دوسه‌تاکسل در بیماران سرطان پستان)، در جایی که توزیع و حتی فضای ویژگی داده‌های مربوط به وظایف می‌تواند متفاوت باشد، بهبود بخشد. در برنامه‌های دنیای واقعی‌، بعضی اوقات ما یک مجموعه داده آموزش محدود در یک کار هدف داریم در حالی که داده‌های کمکی مربوط به یک کار مرتبط هم را داریم. برای به دست آوردن عملکرد پیش‌بینی بهتر در کار هدف، یادگیری نظارت شده نیاز به یک مجموعه داده آموزش به اندازه کافی بزرگ در کار هدف دارد تا بتواند در پیش‌بینی نمونه‌های آزمایشی آینده کار هدف، عملکرد خوبی داشته باشد.

در این مقاله، یک روش یادگیری انتقالی TL برای پیش‌بینی حساسیت دارویی سرطان پیشنهاد می‌شود، که این رویکرد سه روش را ترکیب می‌کند. ابتدا، یک نماینده از زیرمجموعه‌ای از مثال‌ها را از داده‌های کمکی یک کار مربوطه به یک نماینده نزدیک به مجموعه داده آموزش هدف یک کار هدف تغییر می‌کند. دوم، نمایش تغییر‌یافته نمونه‌های منتخب داده‌های کمکی را با مجموعه داده آموزش هدف تراز می‌شود تا نمونه‌هایی با یک نمایش تراز شده با مجموعه داده آموزش هدف بدست آورده شود. سوم، الگوریتم‌های یادگیری ماشین را با استفاده از مجموعه داده آموزش هدف و مثال‌های تراز شده آموزش داده می‌شود. عملکرد این رویکرد در برابر رویکردهای پایه با استفاده از مساحت زیر منحنی (AUC) مشخصه عملکرد سیستم (ROC) در مجموعه داده‌های آزمایش بالینی واقعی مربوط به مولتیپل میلوما، سرطان ریه سلول غیر-کوچک، سرطان پستان سه‌گانه-منفی و سرطان پستان ارزیابی می‌شود. نتایج تجربی نشان می‌دهد که این روش از نظر عملکرد و اهمیت آماری بهتر از رویکردهای پایه است.

 

هدف: پیش‌بینی حساسیت یا مقاومت سرطان به دارو ( یا پیش‌بینی نتیجه بالینی)

ورودی:

مجموعه داده آموزش هدف (داده‌های بیان رده سلولی برای به مولتیپل میلوما)

داده‌های کمکی (داده‌های بیان رده سلولی برای سرطان پستان)

خروجی:

 پاسخ‌دهنده یا پاسخ ندهنده به یک داروی سرطان داده شده

روش‌های قبلی:

  • CANScript (Tumor Ecosystems + Machine Learning Algorithms)
  • Riddick (Gene Expression Signatures of Cancer Cell Lines + Random Forests)
  • Costello (Genomic, Proteomic, and Epigenomic Profiling Data of Cancer Cell Lines)
  • Geeleher (Microarray Data for the Training of Cancer Cell Lines)

 

مشکل روش‌های قبلی: پیش فرض اشتباه (مجموعه داده‌های آموزش و تست در فضای ویژگی و توزیع یکسان قرار دارند) به دلیل داشتن مجموعه داده‌های آموزش محدود

 

روش:

(1) Changing the Representation of a Subset of Examples from Auxiliary Data of a Related Task to a New Representation That is Closer to a Target Training Set of a Target Task Using a Modified Version of a Mean Shift Algorithm

(2) Aligning the Subset of Examples from the Auxiliary Data with the Target Training Set by Employing Procrustes Analysis (PA)

(3) Combining the Target Training Set with the Subset of Examples from Auxiliary Data

الگوریتم‌های یادگیری ماشین به کار رفته در این روش:

  • Support Vector Regression (SVR)
  • Linear Ridge Regression (RR)
  • Logistic Ridge Regression (LR)
  • Support Vector Machines (SVM)

منبع:

worldscientific.com/doi/abs/10.1142/S0219720018400140

BioBERT: یک مدل نمایشی زبان زیست پزشکی از قبل آموزش دیده برای استخراج متن زیست پزشکی

Article: BioBERT: a pre-trained biomedical language representation model for biomedical text mining

Journal: Bioinformatics

Authors: Jinhyuk Lee, Wonjin Yoon, Sungdong Kim, et al.

Affiliation: Department of Computer Science and Engineering, Korea University, Korea

Year: 2020

Citations: 1169

Link: academic.oup.com/bioinformatics/article/36/4/1234/5566506

چکیده:

استخراج متن زیست پزشکی با رشد سریع تعداد اسناد زیست پزشکی به طور فزاینده ای اهمیت پیدا می‌کند. با پیشرفت در پردازش زبان طبیعی (NLP) ، استخراج اطلاعات ارزشمند از منابع پزشکی در بین محققان محبوبیت پیدا کرده است، و یادگیری عمیق باعث توسعه مدل‌های موثر متن کاوی زیست پزشکی شده است.

با این حال ، استفاده مستقیم از پیشرفت‌های موجود در NLP در استخراج متن زیست پزشکی اغلب به دلیل تغییر توزیع کلمه از مجموعه متن‌های حوزه کلی به مجموعه متن‌های زیست پزشکی، نتایج نامطلوبی به همراه دارد. در این مقاله، بررسی می‌شود که چگونه می‌توان مدل زبان پیش آموزش دیده BERT را برای مجموعه متن‌های زیست پزشکی سازگار کرد.

در اینجا روش BioBERT (نمایشگرهای رمزگذار دو طرفه از ترانسفورماتور برای استخراج متن زیست پزشکی) معرفی می‌شود، که یک مدل نمایش زبان حوزه مشخص است و از قبل بر روی مجموعه متن‌های زیست پزشکی در مقیاس بزرگ آموزش دیده است. BioBERT با معماری تقریباً یکسان در بین وظایف، هنگامی که از قبل بر روی مجموعه متن‌های زیست پزشکی آموزش دیده، تا حد زیادی از BERT و مدل های پیشرفته قبلی در انواع وظایف استخراج متن زیست پزشکی بهتر عمل میکند. در حالی که BERT عملکردی قابل مقایسه با مدل‌های پیشرفته قبلی به دست آورده، BioBERT به طور کلی از آنها در سه وظیفه استخراج متن زیست پزشکی نمایشی زیر بهتر عمل می‌کند: تشخیص موجودیت (Named-Entity Recognition) زیست پزشکی (0.62٪ بهبود امتیاز F1)، استخراج رابطه (Relation Extraction) زیست پزشکی (2.80٪) بهبود امتیاز F1) و پاسخ به سوالات (Question Answering) زیست پزشکی (12.24٪ بهبود MRR). نتایج تجزیه و تحلیل آن‌ها نشان می‌دهد که BERT از قبل آموزش دیده بر روی مجموعه متن‌های زیست پزشکی کمک می‌کند تا متون پیچیده زیست پزشکی را درک کنیم.

 

هدف: استخراج اطلاعات از مقاله‌های زیست پزشکی با استفاده از ابزارهای متن کاوی

روش‌های قبلی:

Sub-tasks of Information Extraction (IE):

  • Named Entity Recognition (NER)
  • Long Short-Term Memory (LSTM)
  • Conditional Random Field (CRF)
  • Relation Extraction (RE)
  • Question Answering (QA)

Word Representation Models

  • Word2Vec (context independent)
  • ELMo (pre-trained on only general domain corpora)
  • BERT (pre-trained on only general domain corpora)

مشکل روش‌های قبلی: تنها بر روی مجموعه متن‌هایی با حوزه کلی (نه فقط زیست پزشکی)  از قبل آموزش دیده‌اند.

روش:

  1. Initialize BioBERT with Weights from BERT, Which Was Pre-Trained on General Domain Corpora (English Wikipedia And Bookscorpus)
  2. Pre-Trained on Biomedical Domain Corpora (PubMed Abstracts and PMC Full-Text Articles)
  3. Fine-Tuned and Evaluated on Three Popular Biomedical Text Mining Tasks (NER, RE and QA)

To Show The Effectiveness of  The Approach in Biomedical Text Mining

 

Overview of the pre-training and fine-tuning of BioBERT
Overview of the pre-training and fine-tuning of BioBERT

نکته:

BERT (Bidirectional Encoder Representation from Transformers) دو طرفه - متن را از هر دو جهت می‌خواند. برخلاف مدل‌های جهت‌دار، که ورودی متن را به ترتیب (چپ به راست یا راست به چپ) می‌خوانند، رمزگذار Transformer کل توالی کلمات را یک باره می‌خواند.

 

کاربرد:

موثر در بسیاری از وظایف استخراج متن زیست پزشکی از قبیل تشخیص موجودیت (NER) برای شرح بیماری (clinical notes)، استخراج رابطه (RE) بر روی ژن-فنوتایپ انسانی، و بازه‌های زمانی وقایع بالینی (clinical temporal)

 

منبع:

academic.oup.com/bioinformatics/article/36/4/1234/5566506