Создайте Pandas DataFrame из глубоко вложенного JSON

Я пытаюсь создать единственный объект Pandas DataFrame из глубоко вложенной строки JSON.

Желаемый результат Мне нужно сгладить это, чтобы создать таблицу:

Первый столбец - это значения Pivots, а остальные столбцы - значения ключей interval_id и p_value, хранящихся в списке series.

actor_data - это список, где длина равна числу индивидуумов, т.е. pivots.values(). Объект df просто возвращает

Как я могу перебирать этот список series, чтобы получить значения dict и создать N отдельных столбцов? Должен ли я попытаться создать DataFrame для списка series, изменить его, а затем связать столбцы с именами актеров?

это дает мне список списков. Теперь мне нужно выяснить, как добавить каждый список в строку в DataFrame.

Возвращает правильный DataFrame. Я перенес его так, чтобы люди были рядами, а не столбцами.

Ответы

Ответ 1

Я думаю, что организация ваших данных таким образом, которая дает повторяющиеся имена столбцов, только создаст головные боли для вас позже в будущем. Лучшим подходом IMHO является создание столбца для каждого из pivots, interval_id и p_value. Это очень упростит запрос ваших данных после загрузки в pandas.

Кроме того, ваш JSON имеет некоторые ошибки. Я нашел его для поиска ошибок.

jq помогает здесь

import sh
jq = sh.jq.bake('-M')  # disable colorizing
json_data = "from above"
rule = """[{pivots: .intervals[].pivots, 
            interval_id: .intervals[].series[].interval_id,
            p_value: .intervals[].series[].p_value}]"""
out = jq(rule, _in=json_data).stdout
res = pd.DataFrame(json.loads(out))

Это даст результат, похожий на

    interval_id       p_value      pivots
32            2  2.867501e-06  Jane Smith
33            2  1.000000e+00  Jane Smith
34            2  1.116279e-08  Jane Smith
35            2  2.867501e-06  Jane Smith
36            0  1.000000e+00   Bob Smith
37            0  1.116279e-08   Bob Smith
38            0  2.867501e-06   Bob Smith
39            0  1.000000e+00   Bob Smith
40            0  1.116279e-08   Bob Smith
41            0  2.867501e-06   Bob Smith
42            1  1.000000e+00   Bob Smith
43            1  1.116279e-08   Bob Smith

Адаптировано из этого комментария

Конечно, вы всегда можете вызвать res.drop_duplicates(), чтобы удалить повторяющиеся строки. Это дает

In [175]: res.drop_duplicates()
Out[175]:
    interval_id       p_value      pivots
0             0  1.000000e+00  Jane Smith
1             0  1.116279e-08  Jane Smith
2             0  2.867501e-06  Jane Smith
6             1  1.000000e+00  Jane Smith
7             1  1.116279e-08  Jane Smith
8             1  2.867501e-06  Jane Smith
12            2  1.000000e+00  Jane Smith
13            2  1.116279e-08  Jane Smith
14            2  2.867501e-06  Jane Smith
36            0  1.000000e+00   Bob Smith
37            0  1.116279e-08   Bob Smith
38            0  2.867501e-06   Bob Smith
42            1  1.000000e+00   Bob Smith
43            1  1.116279e-08   Bob Smith
44            1  2.867501e-06   Bob Smith
48            2  1.000000e+00   Bob Smith
49            2  1.116279e-08   Bob Smith
50            2  2.867501e-06   Bob Smith

[18 rows x 3 columns]