Metódy v bioinformatike - 04 - Zostavovanie genómov (dlhé čítania)
Preber si túto prednášku so svojou AI
Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.
Zhrnutie prednášky
Prednáška predstavuje zostavovanie genómov z dlhých a chybových čítaní tretej generácie pomocou prístupu overlap–layout–consensus. De Bruijnove grafy sa na takéto čítania nehodia, pretože rozklad na k-méry zahodí väčšinu dlhodosahovej informácie a pri približne 10 % chybovosti vzniká bublinka takmer na každom mieste grafu. Prístup má tri fázy: nájdenie prekryvov medzi čítaniami, vytvorenie grafu prekryvov s hľadaním ciest (layout) a výpočet konsenzu sekvencie. Hľadanie prekryvov je výpočtovo náročné, keďže pri miliónoch čítaní nemožno porovnávať každý pár, preto sa najprv rýchlo filtrujú páry so spoločným k-mérom a až potom sa robí pomalšie zarovnanie. Na ukážkovom príklade s textom piesne sa ukazuje, že graf prekryvov je v praxi neprehľadný pre opakovania a nadbytočné hrany.
- - De Bruijnove grafy sú pre dlhé chybové čítania nevhodné: rozklad na k-méry stráca informáciu a vzniká príliš veľa bublín.
- - Overlap–layout–consensus vznikol už pri Sangerovom sekvenovaní a s treťou generáciou sa opäť využíva.
- - Prvá fáza hľadá prekryvy medzi čítaniami, ktoré môžu obsahovať sekvenačné chyby (zámeny, vypadnutia, vloženia).
- - Porovnávanie všetkých párov (9 miliónov × 9 miliónov čítaní) je neúnosné, preto sa najprv filtrujú páry so spoločným k-mérom.
- - Pomalé zarovnanie sa robí len pre páry, ktoré prešli filtrom.
- - Graf prekryvov má vrcholy ako čítania a hrany s váhou rovnou dĺžke prekryvu.
- - Opakovania v genóme a nadbytočné hrany robia graf neprehľadným, preto sa vo fáze layout zjednodušuje a hľadajú sa v ňom cesty.
Zhrnutie pripravené s pomocou AI z prepisu videa.
nechodím na prednášky