Как найти открытую рамку чтения в Python

Я использую Python и регулярное выражение для поиска ORF (открытая рамка чтения).

Найдите подстроку строку, которая состоит ТОЛЬКО из букв ATGC (без пробелов или новых строк), которые:

Начинается с ATG, заканчивается на TAG или TAA или TGA и следует рассматривать последовательность из первого символа, затем вторую, а затем третью:

Как я могу найти способ проверить стартовый кодон, а затем найти первый стоп-кодон. Затем найдите следующий стартовый кодон и следующий стоп-кодон.

Я хочу запустить это для трех кадров. Как упоминалось ранее, три кадра рассматривали бы первый, второй и третий символы последовательности как начало.

Также последовательность должна быть разделена на небольшие части 3. Там должно быть что-то вроде этого:

Вышеуказанная функция записи не помогает мне записывать содержимое в текстовый файл. Все, что у меня есть, есть NONE.. Почему эта ошибка.. Может кто-нибудь помочь?

Ответы

Ответ 1

Как вы отметили его Biopython, я полагаю, вы знаете о Biopython. Вы еще проверили документ? http://biopython.org/DIST/docs/tutorial/Tutorial.html#htoc231 может помочь.

Я немного скорректировал код из приведенной выше ссылки для работы над вашей последовательностью:

from Bio.Seq import Seq

seq = Seq("CCTCAGCGAGGACAGCAAGGGACTAGCCAGGAGGGAGAACAGAAACTCCAGAACATCTTGGAAATAGCTCCCAGAAAAGCAAGCAGCCAACCAGGCAGGTTCTGTCCCTTTCACTCACTGGCCCAAGGCGCCACATCTCCCTCCAGAAAAGACACCATGAGCACAGAAAGCATGATCCGCGACGTGGAACTGGCAGAAGAGGCACTCCCCCAAAAGATGGGGGGCTTCCAGAACTCCAGGCGGTGCCTATGTCTCAGCCTCTTCTCATTCCTGCTTGTGGCAGGGGCCACCACGCTCTTCTGTCTACTGAACTTCGGGGTGATCGGTCCCCAAAGGGATGAGAAGTTCCCAAATGGCCTCCCTCTCATCAGTTCTATGGCCCAGACCCTCACACTCAGATCATCTTCTCAAAATTCGAGTGACAAGCCTGTAGCCCACGTCGTAGCAAACCACCAAGTGGAGGAGCAGCTGGAGTGGCTGAGCCAGCGCGCCAACGCCCTCCTGGCCAACGGCATGGATCTCAAAGACAACCAACTAGTGGTGCCAGCCGATGGGTTGTACCTTGTCTACTCCCAGGTTCTCTTCAAGGGACAAGGCTGCCCCGACTACGTGCTCCTCACCCACACCGTCAGCCGATTTGCTATCTCATACCAGGAGAAAGTCAACCTCCTCTCTGCCGTCAAGAGCCCCTGCCCCAAGGACACCCCTGAGGGGGCTGAGCTCAAACCCTGGTATGAGCCCATATACCTGGGAGGAGTCTTCCAGCTGGAGAAGGGGGACCAACTCAGCGCTGAGGTCAATCTGCCCAAGTACTTAGACTTTGCGGAGTCCGGGCAGGTCTACTTTGGAGTCATTGCTCTGTGAAGGGAATGGGTGTTCATCCATTCTCTACCCAGCCCCCACTCTGACCCCTTTACTCTGACCCCTTTATTGTCTACTCCTCAGAGCCCCCAGTCTGTATCCTTCTAACTTAGAAAGGGGATTATGGCTCAGGGTCCAACTCTGTGCTCAGAGCTTTCAACAACTACTCAGAAACACAAGATGCTGGGACAGTGACCTGGACTGTGGGCCTCTCATGCACCACCATCAAGGACTCAAATGGGCTTTCCGAATTCACTGGAGCCTCGAATGTCCATTCCTGAGTTCTGCAAAGGGAGAGTGGTCAGGTTGCCTCTGTCTCAGAATGAGGCTGGATAAGATCTCAGGCCTTCCTACCTTCAGACCTTTCCAGATTCTTCCCTGAGGTGCAATGCACAGCCTTCCTCACAGAGCCAGCCCCCCTCTATTTATATTTGCACTTATTATTTATTATTTATTTATTATTTATTTATTTGCTTATGAATGTATTTATTTGGAAGGCCGGGGTGTCCTGGAGGACCCAGTGTGGGAAGCTGTCTTCAGACAGACATGTTTTCTGTGAAAACGGAGCTGAGCTGTCCCCACCTGGCCTCTCTACCTTGTTGCCTCCTCTTTTGCTTATGTTTAAAACAAAATATTTATCTAACCCAATTGTCTTAATAACGCTGATTTGGTGACCAGGCTGTCGCTACATCACTGAACCTCTGCTCCCCACGGGAGCCGTGACTGTAATCGCCCTACGGGTCATTGAGAGAAATAA")


table = 1
min_pro_len = 100

for strand, nuc in [(+1, seq), (-1, seq.reverse_complement())]:
    for frame in range(3):
        for pro in nuc[frame:].translate(table).split("*"):
            if len(pro) >= min_pro_len:
                print "%s...%s - length %i, strand %i, frame %i" % (pro[:30], pro[-3:], len(pro), strand, frame)

ORF также переводится. Вы можете выбрать другую таблицу переводов. Проверьте http://biopython.org/DIST/docs/tutorial/Tutorial.html#sec:translation

EDIT: Объяснение кода:

В верхней части страницы я создаю объект последовательности из вашей строки. Обратите внимание на seq = Seq("ACGT"). Два цикла for-loop создают 6 разных кадров. Внутренний for-loop переводит каждый кадр в соответствии с выбранной таблицей перевода и возвращает цепочку аминокислот, где каждый стоп-кодон кодируется как *. Функция split разделяет эту строку, удаляя эти заполнители, приводя к списку возможных последовательностей белка. Установив min_pro_len, вы можете определить минимальную длину аминокислотной цепи для белка, который будет обнаружен. 1 - стандартная таблица. Посмотрите http://www.ncbi.nlm.nih.gov/Taxonomy/Utils/wprintgc.cgi#SG1 Здесь вы видите, что кодон инициации AUG (равно ATG) и концевые кодоны (* в нуклеотиде последовательность) TAA, TAG и TGA, как и вы. Вы также можете использовать другую таблицу переводов.

Когда вы добавляете

print nuc[frame:].translate(table)

прямо внутри второго цикла for вы получаете что-то вроде:

PQRGQQGTSQEGEQKLQNILEIAPRKASSQPGRFCPFHSLAQGATSPSRKDTMSTESMIRDVELAEEALPQKMGGFQNSRRCLCLSLFSFLLVAGATTLFCLLNFGVIGPQRDEKFPNGLPLISSMAQTLTLRSSSQNSSDKPVAHVVANHQVEEQLEWLSQRANALLANGMDLKDNQLVVPADGLYLVYSQVLFKGQGCPDYVLLTHTVSRFAISYQEKVNLLSAVKSPCPKDTPEGAELKPWYEPIYLGGVFQLEKGDQLSAEVNLPKYLDFAESGQVYFGVIAL*REWVFIHSLPSPHSDPFTLTPLLSTPQSPQSVSF*LRKGIMAQGPTLCSELSTTTQKHKMLGQ*PGLWASHAPPSRTQMGFPNSLEPRMSIPEFCKGRVVRLPLSQNEAG*DLRPSYLQTFPDSSLRCNAQPSSQSQPPSIYICTYYLLFIYYLFICL*MYLFGRPGCPGGPSVGSCLQTDMFSVKTELSCPHLASLPCCLLFCLCLKQNIYLTQLS**R*FGDQAVATSLNLCSPREP*L*SPYGSLREI

(обратите внимание, что звездочки находятся в положениях стоп-кодона)

EDIT: ответьте на второй вопрос:

Вы должны вернуть строку, которую хотите записать в файл. Создайте строку вывода и верните ее в конце функции:

output = "selected tupple is " + str(selected_tupple) + "\n"
output += final_seq + "\n"
output += "The longest orf length is " + str(max_val) + "\n"
return output

Ответ 2

Если вы хотите с его помощью:

import re
from string import maketrans

pattern = re.compile(r'(?=(ATG(?:...)*?)(?=TAG|TGA|TAA))')

def revcomp(dna_seq):
    return dna_seq[::-1].translate(maketrans("ATGC","TACG"))

def orfs(dna):
    return set(pattern.findall(dna) + pattern.findall(revcomp(dna)))

print orfs(Seq)