Metódy v bioinformatike - 04 - Zostavovanie genómov (dlhé čítania)

Zdroj
ručne priradené
Pridané

Pozrieť na YouTube →

Preber si túto prednášku so svojou AI

Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.

Otvoriť AI: ChatGPT · Claude · Gemini

Zhrnutie prednášky

Prednáška predstavuje zostavovanie genómov z dlhých a chybových čítaní tretej generácie pomocou prístupu overlap–layout–consensus. De Bruijnove grafy sa na takéto čítania nehodia, pretože rozklad na k-méry zahodí väčšinu dlhodosahovej informácie a pri približne 10 % chybovosti vzniká bublinka takmer na každom mieste grafu. Prístup má tri fázy: nájdenie prekryvov medzi čítaniami, vytvorenie grafu prekryvov s hľadaním ciest (layout) a výpočet konsenzu sekvencie. Hľadanie prekryvov je výpočtovo náročné, keďže pri miliónoch čítaní nemožno porovnávať každý pár, preto sa najprv rýchlo filtrujú páry so spoločným k-mérom a až potom sa robí pomalšie zarovnanie. Na ukážkovom príklade s textom piesne sa ukazuje, že graf prekryvov je v praxi neprehľadný pre opakovania a nadbytočné hrany.

  • - De Bruijnove grafy sú pre dlhé chybové čítania nevhodné: rozklad na k-méry stráca informáciu a vzniká príliš veľa bublín.
  • - Overlap–layout–consensus vznikol už pri Sangerovom sekvenovaní a s treťou generáciou sa opäť využíva.
  • - Prvá fáza hľadá prekryvy medzi čítaniami, ktoré môžu obsahovať sekvenačné chyby (zámeny, vypadnutia, vloženia).
  • - Porovnávanie všetkých párov (9 miliónov × 9 miliónov čítaní) je neúnosné, preto sa najprv filtrujú páry so spoločným k-mérom.
  • - Pomalé zarovnanie sa robí len pre páry, ktoré prešli filtrom.
  • - Graf prekryvov má vrcholy ako čítania a hrany s váhou rovnou dĺžke prekryvu.
  • - Opakovania v genóme a nadbytočné hrany robia graf neprehľadným, preto sa vo fáze layout zjednodušuje a hľadajú sa v ňom cesty.

Zhrnutie pripravené s pomocou AI z prepisu videa.