Как удалить все escape-последовательности из списка строк?
Я хочу удалить все типы escape-последовательностей из списка строк. Как я могу это сделать?
ввод:
['william', 'short', '\x80', 'twitter', '\xaa', '\xe2', 'video', 'guy', 'ray']
выход:
['william', 'short', 'twitter', 'video', 'guy', 'ray']
http://docs.python.org/reference/lexical_analysis.html#string-literals
Ответы
Ответ 1
Что-то вроде этого?
>>> from ast import literal_eval
>>> s = r'Hello,\nworld!'
>>> print(literal_eval("'%s'" % s))
Hello,
world!
Изменить: хорошо, это не то, что вы хотите. То, что вы хотите, не может быть сделано в целом, потому что, как объяснил @Sven Марнах, строки фактически не содержат escape-последовательностей. Это просто обозначения в строковых литералах.
Вы можете фильтровать все строки с не-ASCII-символами из списка с помощью
def is_ascii(s):
try:
s.decode('ascii')
return True
except UnicodeDecodeError:
return False
[s for s in ['william', 'short', '\x80', 'twitter', '\xaa',
'\xe2', 'video', 'guy', 'ray']
if is_ascii(s)]
Ответ 2
Если вы хотите удалить некоторые символы, которые вам не нравятся, вы можете использовать функцию translate, чтобы удалить их:
>>> s="\x01\x02\x10\x13\x20\x21hello world"
>>> print(s)
!hello world
>>> s
'\x01\x02\x10\x13 !hello world'
>>> escapes = ''.join([chr(char) for char in range(1, 32)])
>>> t = s.translate(None, escapes)
>>> t
' !hello world'
Это удалит все эти управляющие символы:
001 1 01 SOH (start of heading)
002 2 02 STX (start of text)
003 3 03 ETX (end of text)
004 4 04 EOT (end of transmission)
005 5 05 ENQ (enquiry)
006 6 06 ACK (acknowledge)
007 7 07 BEL '\a' (bell)
010 8 08 BS '\b' (backspace)
011 9 09 HT '\t' (horizontal tab)
012 10 0A LF '\n' (new line)
013 11 0B VT '\v' (vertical tab)
014 12 0C FF '\f' (form feed)
015 13 0D CR '\r' (carriage ret)
016 14 0E SO (shift out)
017 15 0F SI (shift in)
020 16 10 DLE (data link escape)
021 17 11 DC1 (device control 1)
022 18 12 DC2 (device control 2)
023 19 13 DC3 (device control 3)
024 20 14 DC4 (device control 4)
025 21 15 NAK (negative ack.)
026 22 16 SYN (synchronous idle)
027 23 17 ETB (end of trans. blk)
030 24 18 CAN (cancel)
031 25 19 EM (end of medium)
032 26 1A SUB (substitute)
033 27 1B ESC (escape)
034 28 1C FS (file separator)
035 29 1D GS (group separator)
036 30 1E RS (record separator)
037 31 1F US (unit separator)
Для Python новее, чем 3.1, последовательность отличается:
>>> s="\x01\x02\x10\x13\x20\x21hello world"
>>> print(s)
!hello world
>>> s
'\x01\x02\x10\x13 !hello world'
>>> escapes = ''.join([chr(char) for char in range(1, 32)])
>>> translator = str.maketrans('', '', escapes)
>>> t = s.translate(translator)
>>> t
' !hello world'
Ответ 3
Вы можете отфильтровать "слова", которые не являются буквенно-цифровыми, используя понимание списка и str.isalnum()
:
>>> l = ['william', 'short', '\x80', 'twitter', '\xaa', '\xe2', 'video', 'guy', 'ray']
>>> [word for word in l if word.isalnum()]
['william', 'short', 'twitter', 'video', 'guy', 'ray']
Если вы хотите отфильтровать номера, используйте str.isalpha()
вместо:
>>> l = ['william', 'short', '\x80', 'twitter', '\xaa', '\xe2', 'video', 'guy', 'ray', '456']
>>> [word for word in l if word.isalpha()]
['william', 'short', 'twitter', 'video', 'guy', 'ray']
Ответ 4
Это невозможно сделать, по крайней мере, в широком объеме, о котором вы просите. Как уже говорили другие, python времени выполнения не знает разницы между чем-то с escape-последовательностями и чем-то без.
Пример:
print ('\x61' == 'a')
печатает True
. Поэтому нет способа найти разницу между этими двумя строками, если вы не попробуете какой-то статический анализ вашего python script.
Ответ 5
У меня были подобные проблемы при преобразовании из hexadimal в String. Это то, что в конечном итоге работало на python
Пример
list_l = ['william', 'short', '\x80', 'twitter', '\xaa', '\xe2', 'video', 'guy', 'ray']
decode_data=[]
for l in list_l:
data =l.decode('ascii', 'ignore')
if data != "":
decode_data.append(data)
# output :[u'william', u'short', u'twitter', u'video', u'guy', u'ray']
Ответ 6
В Python 3.6 у меня работает следующее:
word = '\t\t\t\t\t\ntest\t msg'
filter = ''.join([chr(i) for i in range(1, 32)])
word.translate(str.maketrans('', '', filter))
Выход:
'test msg'
Источник здесь