Boltz-2

Bevezetés

A Boltz-2 egy biomolekuláris szerkezetpredikciós eszköz, amely képes fehérjék, nukleinsavak, ligandumok és különböző biomolekuláris komplexek modellezésére. A bemenetet YAML formátumú fájlban kell megadni, amely leírja a rendszer komponenseit és a számítás paramétereit.

Ebben a példában a Boltz-2 használatát a 11CE PDB azonosítójú kristályszerkezeten mutatjuk be.

../_images/11CE.png

A rendszer egy fehérjét és egy koordinált cinkiont tartalmaz. A Boltz-2 input elkészítéséhez a PDB-szerkezetből kinyerjük

  • a fehérje aminosavsorrendjét,

  • a kötött cinkion(ok) jelenlétét,

  • a láncok azonosítóit.

A cél egy protein-ligand komplex szerkezetének előrejelzése, ahol a ligand egy kétszeresen pozitív töltésű cinkion.

FASTA szekvencia letöltése a PDB adatbázisból

  1. Nyissuk meg a 2V0X rekordot a PDB felületén (https://www.rcsb.org/structure/11CE).

  2. Válasszuk a “Download Files” menüt.

  3. Töltsük le a FASTA szekvenciát.

  4. Másoljuk a kívánt lánc aminosav-szekvenciáját az Boltz-2 .yaml input fájl megfelelő mezőjébe.

A FASTA formátum például az alábbi szerkezetet követi (rcsb_pdb_11CE.fasta):

>11CE_1|Chain A|The protease-Zn (II) complex of Zn5|synthetic construct (32630)
MSGMTAEELAERIGEALARGRWDEVYALGAYAFLTLTPEEIEEMRRRLREVLREELKKLGKTYSDEEVDRLVEAAVYEGEASAVVVRRYREEGLPEDMTDEQLFELGMLHEAYHVNFGDAYVVADGKEGIVEVLVARTEEELEEARRLAERAREEGKEVRFFKKGEEEAVIEWLREVAEKYPKVREGLIEGTRRLLEEYRKIVGSAWSHPQFEK

Boltz-2 input létrehozása

A fehérjét és a cinkiont YAML formátumban adjuk meg (11CE.yaml):

version: 1

sequences:
  - protein:
      id: A
      sequence: MSGMTAEELAERIGEALARGRWDEVYALGAYAFLTLTPEEIEEMRRRLREVLREELKKLGKTYSDEEVDRLVEAAVYEGEASAVVVRRYREEGLPEDMTDEQLFELGMLHEAYHVNFGDAYVVADGKEGIVEVLVARTEEELEEARRLAERAREEGKEVRFFKKGEEEAVIEWLREVAEKYPKVREGLIEGTRRLLEEYRKIVGSAWSHPQFEK

  - ligand:
      id: ZN
      smiles: "[Zn+2]"

A számítás futtatása

A számítás a YAML inputfájl megadásával indítható.

Online MSA szolgáltatás használatával:

boltz predict 11CE.yaml --use_msa_server

Amennyiben a szükséges adatbázisok lokálisan rendelkezésre állnak, az MSA-k helyben is előállíthatók:

boltz predict 11CE.yaml

A Boltz-2 a futás során automatikusan létrehozza a szükséges munkakönyvtárakat, majd elkészíti az MSA-kat, a szerkezetpredikciót és a konfidenciaértékeket.

A futás eredményei

A számítás befejezése után a Boltz egy eredménykönyvtárat hoz létre, amely a bemeneti fájl nevéből képződik. A könyvtárszerkezet a következőhöz hasonló:

boltz_results_11CE/
├── predictions/
│   └── 11CE/
│       ├── 11CE_model_0.cif
│       ├── confidence_11CE_model_0.json
│       └── ...
├── processed/
├── lightning_logs/
└── msa/

A legfontosabb fájlok és könyvtárak:

  • predictions/11CE/

    A predikció eredményeit tartalmazó könyvtár.

  • 11CE_model_0.cif

    A prediktált szerkezet mmCIF formátumban. Ez a fájl közvetlenül megnyitható Maestro, ChimeraX vagy PyMOL programokkal.

  • confidence_11CE_model_0.json

    A modellhez tartozó megbízhatósági mutatókat tartalmazza. Többek között a prediktált szerkezeti bizonytalanság és a modell konfidenciaértékei találhatók benne.

  • processed/

    A Boltz által előfeldolgozott bemeneti állományokat tartalmazza. Ezeket a program a futás során automatikusan hozza létre.

  • lightning_logs/

    A PyTorch Lightning által generált naplófájlok és futtatási információk helye.

  • msa/

    A többszörös szekvenciaillesztések (MSA-k) tárolására szolgáló könyvtár. Ha a futtatás során MSA-generálás történt, az itt található fájlok kerülnek felhasználásra a modell bemeneteként.

A további elemzések során elsősorban a 11CE_model_0.cif fájlt használjuk, amely a Boltz által legjobbnak ítélt szerkezeti modellt tartalmazza.

Note

Egyes futtatások több modellt is generálhatnak. Ebben az esetben a predictions könyvtárban több model_* állomány jelenik meg. A további vizsgálatokhoz általában a legnagyobb konfidenciájú modell használata javasolt.

A prediktált szerkezet megjelenítése

A CIF formátumban kapott szerkezet megnyitható több molekulamegjelenítő szoftverrel.

Gyakran használt programok:

  • PyMOL

  • UCSF ChimeraX

  • VMD

Például ChimeraX használata esetén:

File → Open → 11CE_model_0.cif

A betöltött szerkezeten ellenőrizhető a cinkion pozíciója és a feltételezett koordinációs környezet.

../_images/11CE_Boltz.png

A predikció konfidenciájának vizsgálata

A pLDDT értékek megjelenítése mellett érdemes megvizsgálni az AlphaFold által becsült predikciós hibát is.

Ehhez a ChimeraX beépített AlphaFold eszközeit használjuk.

A menüsorban válasszuk:

Tools → Structure Prediction → AlphaFold Error Plot

A megnyíló ablakban a ‘structure’-nél ki kell választani a 11CE_model_0.cif fájlt és ‘Predicted align error (PAE) from:’-nál a file(.json or .npy or .npz or .pkl) opciót. Ügyeljünk arra, hogy .cif-et tartalmazó mappában legyenek a PAE, plDDT és pDE-re vonatkozó output fájlok is.

A új megnyíló ablak az úgynevezett Predicted Aligned Error (PAE) mátrixot jeleníti meg.

A PAE azt mutatja meg, hogy az AlphaFold mekkora pozíciós hibát becsül két aminosav egymáshoz viszonyított elhelyezkedésére.

A grafikon értelmezése

A diagram mindkét tengelyén a fehérje aminosavai szerepelnek.

Minden pixel egy adott aminosavpárhoz tartozó becsült hibát jelöl:

  • alacsony érték → nagy biztonság

  • magas érték → bizonytalan relatív pozíció

A színskála jellemzően a következő:

Szín

Értelmezés

Sötétkék

Nagyon alacsony becsült hiba

Világoskék

Alacsony becsült hiba

Sárga

Közepes bizonytalanság

Narancs/Piros

Magas becsült hiba

../_images/11CE_errorplot.png

A grafikon alatt elhelyezkedő gombok segítségével lehet színezni a fehérjéjet a PAE és pLDDT értékek szerint.

A PAE és a pLDDT különbsége

A pLDDT az egyes aminosavak lokális pontosságát mutatja.

../_images/11CE_plDDT.png

A PAE ezzel szemben azt mutatja meg, hogy két régió egymáshoz viszonyított elhelyezkedése mennyire megbízható.

../_images/11CE_pae.png

Ez különösen fontos:

  • több doménből álló fehérjéknél,

  • fehérjekomplexeknél,

  • homodimereknél és heterodimereknél.

A predikció összehasonlítása a kristályszerkezettel

A Boltz-2 által generált modell összehasonlítható az eredeti 11CE kristályszerkezettel. Az illesztést UCSF ChimeraX Matchmaker algoritmusával végeztük.

A prediktált szerkezet: 11CE_model_0.cif

A referencia szerkezet: 11ce.pdb

../_images/11CE_compare.png

Az ábrán kék színnel látható a kristályszerkezet, rózsaszínnel pedig a Boltz-2 által meghatározott szerkezetpredikció.

Az illesztés eredménye:

Matchmaker 11CE_model_0.cif, chain A (#2)
with 11ce.pdb, chain A (#1),
sequence alignment score = 1059.7

RMSD between 191 pruned atom pairs is 0.822 angstroms;
(across all 203 pairs: 1.334)

Az RMSD érték 0,822 Å a Matchmaker által megtartott 191 atompár esetén, ami nagyon jó egyezést jelez a prediktált és a kristályosan meghatározott szerkezet között.

Ha az összes illesztett atompárt figyelembe vesszük, az RMSD 1,334 Å, ami továbbra is magas szerkezeti hasonlóságot mutat.

A kapott eredmények alapján a Boltz-2 sikeresen reprodukálja a 11CE szerkezet globális hajtogatását és a cinkiont kötő szerkezeti motívumokat.

Az eredmények értelmezése

Általánosságban:

  • RMSD < 1 Å: kiváló egyezés

  • RMSD 1-2 Å: nagyon jó egyezés

  • RMSD 2-4 Å: megfelelő globális szerkezet

  • RMSD > 4 Å: jelentős eltérés

A 11CE példában kapott 0,822 Å RMSD azt mutatja, hogy a Boltz-2 a natív szerkezethez rendkívül közeli konformációt állított elő.

Ez a példa jól demonstrálja, hogy egyszerű protein-fémion rendszerek esetén a Boltz-2 magas pontosságú szerkezeti predikcióra képes.

Továbblépési lehetőségek

A fenti példa a legegyszerűbb protein-fémion rendszerre mutat be egy teljes munkafolyamatot. A Boltz-2 azonban ennél összetettebb rendszerek kezelésére is alkalmas.

Több fehérjeláncból álló komplexek

Amennyiben a rendszer több fehérjeláncot tartalmaz, minden láncot külön kell megadni a sequences szakaszban.

Például egy A és B láncból álló homodimer vagy heterodimer esetén:

version: 1

sequences:
  - protein:
      id: A
      sequence: MSEQNNTEMTFQIQRIYTKDISFEAPNAPHVFQ

  - protein:
      id: B
      sequence: MPEEKSAVTALWGKVNVDEVGGEALGRLLVV

A Boltz-2 ilyenkor nemcsak az egyes láncok szerkezetét becsli meg, hanem azok egymáshoz viszonyított elhelyezkedését is.

Fehérje-ligand komplexek

Kismolekulás ligandok SMILES formátumban adhatók meg.

Példa ATP hozzáadására:

version: 1

sequences:
  - protein:
      id: A
      sequence: MSEQNNTEMTFQIQRIYTKDISFEAPNAPHVFQ

  - ligand:
      id: ATP
      smiles: "Nc1ncnc2n(cnc12)[C@@H]3O[C@H](COP(O)(O)=O)[C@@2

Megpróbálja meghatározni a ligand valószínű kötődési helyét és orientációját.

Nukleinsavakat tartalmazó rendszerek

A Boltz-2 képes DNS- és RNS-szekvenciák kezelésére is.

Egyszálú DNS példa:

version: 1

sequences:
  - dna:
      id: D
      sequence: ATGCGATCGATCGATCGATC

Egyszálú RNS példa:

version: 1

sequences:
  - rna:
      id: R
      sequence: AUGCGAUCGAUCGAUCGAUC

Fehérje-DNS komplex

A fehérje és a DNS együttesen is megadható ugyanabban az inputban.

version: 1

sequences:
  - protein:
      id: A
      sequence: MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQ

  - dna:
      id: D
      sequence: ATCGATCGATCGATCGATCG

A program ilyen esetben a fehérje és a nukleinsav egymáshoz viszonyított elrendezését is megjósolja.

Fehérje–ligand–ion rendszerek

A különböző komponensek szabadon kombinálhatók.

Például egy fehérje, egy ATP molekula és egy magnéziumion:

version: 1

sequences:
  - protein:
      id: A
      sequence: MSEQNNTEMTFQIQRIYTKDISFEAPNAPHVFQ

  - ligand:
      id: ATP
      smiles: "Nc1ncnc2n(cnc12)[C@@H]3O[C@H](COP(O)(O)=O)[C@@H](O)[C         id: MG
      smiles: "[Mg+2]"

Kovalensen kötött ligandok

A Boltz-2 támogatja kovalensen kapcsolódó módosítások kezelését is. Ilyenkor a molekulák közötti kötéseket külön meg kell adni a megfelelő szekcióban.

Tipikus alkalmazások:

  • foszforiláció,

  • glikoziláció,

  • kovalens inhibitorok,

  • kromofórok,

  • prosztetikus csoportok.

Összetett rendszerek

A legösszetettebb inputok több fehérjét, nukleinsavat, ligandumot és iont is tartalmazhatnak egyszerre.

Például:

version: 1

sequences:
  - protein:
      id: A
      sequence: ...

  - protein:
      id: B
      sequence: ...

  - dna:
      id: D
      sequence: ...

  - ligand:
      id: ATP
      smiles: ...

  - ligand:
      id: MG
      smiles: "[Mg+2]"

Ilyen rendszerekkel transzkripciós faktorok, enzim-komplexek vagy ribonukleoprotein szerkezetek vizsgálhatók.