SCOP (banco de dados)
O banco de dados de Classificação Estrutural de Proteínas (SCOP) é uma classificação amplamente manual de domínios estruturais de proteínas baseada em semelhanças das suas estruturas e sequências de aminoácidos. Uma motivação para esta classificação é determinar a relação evolutiva entre as proteínas. Proteínas com os mesmos formatos, mas com pouca semelhança de sequência ou funcional, são colocadas em diferentes superfamílias, e assume-se que possuem apenas um ancestral comum muito distante. Proteínas que possuem o mesmo formato e alguma semelhança de sequência e/ou função são colocadas em "famílias", e assume-se que possuem um ancestral comum mais próximo.
Semelhante aos bancos de dados CATH e Pfam, o SCOP fornece uma classificação de domínios estruturais individuais de proteínas, em vez de uma classificação das proteínas inteiras, que podem incluir um número significativo de domínios diferentes.
O banco de dados SCOP é de livre acesso na internet. O SCOP foi criado em 1994 no Centro de Engenharia de Proteínas e no Laboratório de Biologia Molecular.[1] Foi mantido por Alexey G. Murzin e os seus colegas no Centro de Engenharia de Proteínas até ao seu encerramento em 2010 e, posteriormente, no Laboratório de Biologia Molecular em Cambridge, Inglaterra.[2][3][4][5]
O trabalho no SCOP 1.75 foi interrompido em 2014. Desde então, a equipa do SCOPe da UC Berkeley tem sido responsável por atualizar o banco de dados de maneira compatível, com uma combinação de métodos automatizados e manuais. Desde abril de 2019[update], a versão mais recente é o SCOPe 2.07 (Março de 2018).[6]
A nova versão 2 do banco de dados de Classificação Estrutural de Proteínas (SCOP2) foi lançada no início de 2020. A nova atualização apresentou um esquema de banco de dados aprimorado, uma nova API e uma interface web modernizada. Esta foi a atualização mais significativa do grupo de Cambridge desde o SCOP 1.75 e baseia-se nos avanços de esquema do protótipo SCOP 2.[7]
Organização hierárquica
editarA fonte das estruturas proteicas é o Protein Data Bank. A unidade de classificação de estrutura no SCOP é o domínio proteico. O que os autores do SCOP querem dizer com "domínio" é sugerido pela sua afirmação de que proteínas pequenas e a maioria das médias possuem apenas um domínio,[8] e pela observação de que a hemoglobina humana,[9] que possui uma estrutura α2β2, recebe dois domínios SCOP, um para a subunidade α e outro para a β.
Os formatos dos domínios são chamados de "dobras" (folds) no SCOP. Domínios pertencentes à mesma dobra possuem as mesmas estruturas secundárias principais no mesmo arranjo com as mesmas conexões topológicas. São fornecidas 1195 dobras na versão 1.75 do SCOP. Breves descrições de cada dobra são fornecidas. Por exemplo, a dobra "tipo globina" é descrita como núcleo: 6 hélices; folha dobrada, parcialmente aberta. A dobra à qual um domínio pertence é determinada por inspeção, e não por software.
Os níveis da versão 1.75 do SCOP são os seguintes:
- Classe: Tipos de dobras, por exemplo, folhas beta.
- Dobra (Fold): Os diferentes formatos de domínios dentro de uma classe.
- Superfamília: Os domínios numa dobra são agrupados em superfamílias, que possuem pelo menos um ancestral comum distante.
- Família: Os domínios numa superfamília são agrupados em famílias, que possuem um ancestral comum mais recente.
- Domínio proteico: Os domínios em famílias são agrupados em domínios proteicos, que são essencialmente a mesma proteína.
- Espécie: Os domínios em "domínios proteicos" são agrupados de acordo com a espécie.
- Domínio: parte de uma proteína. Para proteínas simples, pode ser a proteína inteira.
Classes
editarOs grupos mais amplos na versão 1.75 do SCOP são as classes de dobras de proteínas. Estas classes agrupam estruturas com composição de estrutura secundária semelhante, mas diferentes estruturas terciárias globais e origens evolutivas. Este é o nível superior "raiz" da classificação hierárquica do SCOP.
- Proteínas todas alfa [46456] (284): Domínios consistindo de hélices-α
- Proteínas todas beta [48724] (174): Domínios consistindo de folhas-β
- Proteínas alfa e beta (a/b) [51349] (147): Principalmente folhas beta paralelas (unidades beta-alfa-beta)
- Proteínas alfa e beta (a+b) [53931] (376): Principalmente folhas beta antiparalelas (regiões alfa e beta segregadas)
- Proteínas de múltiplos domínios (alfa e beta) [56572] (66): Dobras consistindo de dois ou mais domínios pertencentes a classes diferentes
- Proteínas e peptídeos de membrana e superfície celular [56835] (58): Não inclui proteínas do sistema imunológico
- Proteínas pequenas [56992] (90): Geralmente dominadas por ligante metálico, cofator e/ou pontes dissulfeto
- Proteínas de hélice superenrolada (coiled-coil) [57942] (7): Não é uma classe verdadeira
- Estruturas proteicas de baixa resolução [58117] (26): Peptídeos e fragmentos. Não é uma classe verdadeira
- Peptídeos [58231] (121): peptídeos e fragmentos. Não é uma classe verdadeira.
- Proteínas projetadas [58788] (44): Estruturas experimentais de proteínas com sequências essencialmente não naturais. Não é uma classe verdadeira
O número entre colchetes, chamado de "sunid", é um identificador inteiro único do SCOP (SCOP unique integer identifier) para cada nó na hierarquia. O número entre parênteses indica quantos elementos existem em cada categoria. Por exemplo, existem 284 dobras na classe "Proteínas todas alfa". Cada membro da hierarquia é uma ligação para o próximo nível da hierarquia.
Dobras (Folds)
editarCada classe contém um número de dobras distintas. Este nível de classificação indica estrutura terciária semelhante, mas não necessariamente parentesco evolutivo. Por exemplo, a classe "Proteínas todas-α" contém >280 dobras distintas, incluindo: tipo Globina (núcleo: 6 hélices; folha dobrada, parcialmente aberta), grampo alfa longo (2 hélices; grampo antiparalelo, torção para a esquerda) e domínios de dockerina Tipo I (repetição em tandem de dois motivos hélice-alça de ligação ao cálcio, distintos da mão EF).
Superfamílias
editarDomínios dentro de uma dobra são ainda classificados em superfamílias. Este é o maior agrupamento de proteínas para o qual a semelhança estrutural é suficiente para indicar parentesco evolutivo e, portanto, compartilhar um ancestral comum. No entanto, presume-se que este ancestral seja distante, porque os diferentes membros de uma superfamília têm baixas identidades de sequência. Por exemplo, as duas superfamílias da dobra "tipo globina" são: a superfamília da globina e a superfamília da ferredoxina alfa-helicoidal (contém dois aglomerados Fe4-S4).
Famílias
editarFamílias de proteínas são mais estreitamente relacionadas do que superfamílias. Domínios são colocados na mesma família se tiverem:
- >30% de identidade de sequência
- alguma identidade de sequência (ex: 15%) e realizarem a mesma função
A semelhança na sequência e na estrutura é evidência de que estas proteínas têm uma relação evolutiva mais próxima do que proteínas na mesma superfamília. Ferramentas de sequência, como o BLAST, são usadas para auxiliar na colocação de domínios em superfamílias e famílias. Por exemplo, as quatro famílias na superfamília "tipo globina" da dobra "tipo globina" são hemoglobina truncada (carece da primeira hélice), mini-hemoglobina de tecido nervoso (carece da primeira hélice, mas de resto é mais semelhante às globinas convencionais do que as truncadas), globinas (proteína de ligação ao heme) e proteínas de ficobilissomo do tipo ficocianina (oligômeros de dois tipos diferentes de subunidades do tipo globina contendo duas hélices extras no N-terminal que ligam um cromóforo bilina). Às famílias no SCOP é atribuída uma string de classificação concisa, sccs, onde a letra identifica a classe à qual o domínio pertence; os inteiros seguintes identificam a dobra, superfamília e família, respectivamente (ex: a.1.1.2 para a família "Globina").[10]
Domínios de entrada PDB
editarUm "TaxId" é o número de ID de taxonomia e liga-se ao navegador de taxonomia do NCBI, que fornece mais informações sobre a espécie à qual a proteína pertence. Clicar numa espécie ou isoforma abre uma lista de domínios. Por exemplo, a proteína "Hemoglobina, cadeia alfa de Humano (Homo sapiens)" possui >190 estruturas proteicas resolvidas, como 2dn3 (complexada com cmo) e 2dn1 (complexada com hem, mbn, oxy). Clicar nos números do PDB deveria exibir a estrutura da molécula, mas as ligações estão atualmente quebradas (ligações funcionam no pré-SCOP).
Exemplo
editarA maioria das páginas no SCOP contém uma caixa de pesquisa. Inserir "tripsina +humano" recupera várias proteínas, incluindo a proteína tripsinogênio de humanos. Selecionar essa entrada exibe uma página que inclui a "linhagem" (lineage), que está no topo da maioria das páginas do SCOP.
- Linhagem do tripsinogênio humano
- Raiz: scop
- Classe: Proteínas todas beta [48724]
- Dobra: Proteases de serina do tipo tripsina [50493]
- barril, fechado; n=6, S=8; greek-key
- duplicação: consiste em dois domínios da mesma dobra
- Superfamília: Proteases de serina do tipo tripsina [50494]
- Família: Proteases eucarióticas [50514]
- Proteína: Tripsina (ogênio) [50515]
- Espécie: Humano (Homo sapiens) [TaxId: 9606] [50519]
Pesquisar por "Subtilisina" retorna a proteína, "Subtilisina de Bacillus subtilis, carlsberg", com a seguinte linhagem.
- Linhagem da Subtilisina de Bacillus subtilis, carlsberg
- Raiz: scop
- Classe: Proteínas alfa e beta (a/b) [51349]
- Principalmente folhas beta paralelas (unidades beta-alfa-beta)
- Dobra: Tipo subtilisina [52742]
- 3 camadas: a/b/a, folha beta paralela de 7 fitas, ordem 2314567; conexão crossover para a esquerda entre as fitas 2 e 3
- Superfamília: Tipo subtilisina [52743]
- Família: Subtilases [52744]
- Proteína: Subtilisina [52745]
- Espécie: Bacillus subtilis, carlsberg [TaxId: 1423] [52746]
Embora ambas as proteínas sejam proteases, elas nem sequer pertencem à mesma dobra, o que é consistente com serem um exemplo de evolução convergente.
Comparação com outros sistemas de classificação
editarA classificação SCOP é mais dependente de decisões manuais do que a classificação semiautomática pelo CATH, seu principal rival. A perícia humana é usada para decidir se certas proteínas são evolutivamente relacionadas e, portanto, devem ser atribuídas à mesma superfamília de proteínas, ou se a sua semelhança é resultado de restrições estruturais e, portanto, pertencem à mesma dobra. Outro banco de dados, FSSP, é gerado de forma puramente automática (incluindo atualizações automáticas regulares), mas não oferece classificação, permitindo que o utilizador tire a sua própria conclusão quanto à significância das relações estruturais com base nas comparações pareadas de estruturas proteicas individuais.
Sucessores do SCOP
editarEm 2009, o banco de dados SCOP original classificou manualmente 38.000 entradas PDB numa estrutura estritamente hierárquica. Com o ritmo acelerado de publicações de estruturas de proteínas, a automação limitada da classificação não conseguiu acompanhar, levando a um conjunto de dados não abrangente. O banco de dados de Classificação Estrutural de Proteínas estendido (SCOPe) foi lançado em 2012 com automação muito maior do mesmo sistema hierárquico e é totalmente compatível com a versão 1.75 do SCOP. Em 2014, a curadoria manual foi reintroduzida no SCOPe para manter a atribuição precisa da estrutura. Em fevereiro de 2015, o SCOPe 2.05 classificava 71.000 das 110.000 entradas totais do PDB.[11]
O protótipo SCOP2 era uma versão beta da Classificação estrutural de proteínas e sistema de classificação que visava mover a complexidade evolutiva inerente à evolução da estrutura proteica.[12] Portanto, não é uma hierarquia simples, mas uma rede de grafo acíclico dirigido conectando superfamílias de proteínas que representam relações estruturais e evolutivas, tais como permutações circulares, fusão de domínios e decaimento de domínios. Consequentemente, os domínios não são separados por fronteiras fixas estritas, mas são definidos pelas suas relações com as outras estruturas mais semelhantes. O protótipo foi utilizado para o desenvolvimento da base de dados SCOP versão 2.[7] A versão 2 do SCOP, lançada em janeiro de 2020, contém 5134 famílias e 2485 superfamílias.
O banco de dados de Classificação Evolutiva de Domínios de Proteínas (ECOD), lançado em 2014, é uma expansão do SCOP versão 1.75 semelhante ao SCOPe. Ao contrário do compatível SCOPe, ele renomeia a hierarquia classe-dobra-superfamília-família num agrupamento arquitetura-X-homologia-topologia-família (A-XHTF).[13] ECOD cobre cada estrutura PDB e é atualizado quinzenalmente.[14]
Ver também
editarReferências
- ↑ Murzin AG, Brenner SE, Hubbard T, Chothia C (abril de 1995). «SCOP: a structural classification of proteins database for the investigation of sequences and structures». Journal of Molecular Biology. 247 (4): 536–40. PMID 7723011. doi:10.1016/S0022-2836(05)80134-2
- ↑ Hubbard TJ, Ailey B, Brenner SE, Murzin AG, Chothia C (janeiro de 1999). «SCOP: a Structural Classification of Proteins database». Nucleic Acids Research. 27 (1): 254–6. PMC 148149
. PMID 9847194. doi:10.1093/nar/27.1.254
- ↑
Lo Conte L, Ailey B, Hubbard TJ, Brenner SE, Murzin AG, Chothia C (janeiro de 2000). «SCOP: a structural classification of proteins database». Nucleic Acids Research. 28 (1): 257–9. PMC 102479
. PMID 10592240. doi:10.1093/nar/28.1.257
- ↑
Andreeva A, Howorth D, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (janeiro de 2004). «SCOP database in 2004: refinements integrate structure and sequence family data». Nucleic Acids Research. 32 (Database issue): D226-9. PMC 308773
. PMID 14681400. doi:10.1093/nar/gkh039
- ↑ Andreeva A, Howorth D, Chandonia JM, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (janeiro de 2008). «Data growth and its impact on the SCOP database: new developments». Nucleic Acids Research. 36 (Database issue): D419-25. PMC 2238974
. PMID 18000004. doi:10.1093/nar/gkm993 - ↑ Chandonia JM, Fox NK, Brenner SE (janeiro de 2019). «SCOPe: classification of large macromolecular structures in the structural classification of proteins-extended database». Nucleic Acids Research. 47 (D1): D475–D481. PMC 6323910
. PMID 30500919. doi:10.1093/nar/gky1134 - 1 2
Andreeva A, Kulesha E, Gough J, Murzin AG (janeiro de 2020). «SCOP database in 2020:: expanded classification of representative family and superfamily domains of known protein structures». Nucleic Acids Research. 48 (Database issue): D376–D382. PMC 7139981
. PMID 31724711. doi:10.1093/nar/gkz1064
- ↑ Murzin AG, Brenner SE, Hubbard T, Chothia C (abril de 1995). «SCOP: a structural classification of proteins database for the investigation of sequences and structures» (PDF). Journal of Molecular Biology. 247 (4): 536–40. PMID 7723011. doi:10.1016/S0022-2836(05)80134-2. Cópia arquivada (PDF) em 26 de abril de 2012
- ↑ PDB 2DN1; Park SY, Yokoyama T, Shibayama N, Shiro Y, Tame JR (julho de 2006). «1.25 A resolution crystal structures of human haemoglobin in the oxy, deoxy and carbonmonoxy forms». Journal of Molecular Biology. 360 (3): 690–701. PMID 16765986. doi:10.1016/j.jmb.2006.05.036
- ↑ Lo Conte L, Brenner SE, Hubbard TJ, Chothia C, Murzin AG (janeiro de 2002). «SCOP database in 2002: refinements accommodate structural genomics». Nucleic Acids Research. 30 (1): 264–7. PMC 99154
. PMID 11752311. doi:10.1093/nar/30.1.264 - ↑ «Qual é a relação entre SCOP, SCOPe e SCOP2». scop.berkeley.edu. Consultado em 22 de agosto de 2015
- ↑ Andreeva A, Howorth D, Chothia C, Kulesha E, Murzin AG (janeiro de 2014). «SCOP2 prototype: a new approach to protein structure mining.». Nucleic Acids Research. 42 (Database issue): D310-4. PMC 3964979
. PMID 24293656. doi:10.1093/nar/gkt1242 - ↑ Cheng H, Schaeffer RD, Liao Y, Kinch LN, Pei J, Shi S, Kim BH, Grishin NV (dezembro de 2014). «ECOD: an evolutionary classification of protein domains». PLOS Computational Biology. 10 (12). Bibcode:2014PLSCB..10E3926C. PMC 4256011
. PMID 25474468. doi:10.1371/journal.pcbi.1003926
- ↑ «Classificação Evolutiva de Domínios de Proteínas». prodata.swmed.edu. Consultado em 18 de maio de 2019
Ligações externas
editar- Structural Classification of Proteins (SCOP 2) - Classificação manual de domínios representativos, atualizada regularmente pelos autores do SCOP
- Structural Classification of Proteins (SCOP 1.75) - Site legado do SCOP 1.75, não mais atualizado
- Structural Classification of Proteins extended (SCOPe) - O sucessor mais automatizado do SCOP versão 1.75
- Evolutionary Classification of Protein Domains (ECOD) - Classificação evolutiva baseada no SCOP versão 1.75 e Pfam
- Structural Classification of Proteins 2 (SCOP2 prototype) - Site legado do protótipo SCOP 2, não mais atualizado
- SUPERFAMILY - Biblioteca de HMMs representando superfamílias SCOP
- Protein Structure Classification - capítulo de livro que discute diferentes classificações.