GROUP BY/SUM из оболочки

У меня есть большой файл, содержащий такие данные:

a 23
b 8
a 22
b 1

Я хочу, чтобы получить это:

a 45
b 9

Я могу сначала отсортировать этот файл, а затем сделать это в Python, сканируя файл один раз. Что это за хороший способ командной строки?

Ответы

Ответ 1

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort +0n -1

Надеюсь, это поможет.

Ответ 2

Нет необходимости в awk здесь или даже сортировать - если у вас есть Bash 4.0, вы можете использовать ассоциативные массивы:

#!/bin/bash
declare -A values
while read key value; do
  values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
  printf "%s %s\n" "$key" "${values[$key]}"
done

... или, если вы сначала отсортируете файл (который будет более экономичным для памяти, GNU sort сможет делать трюки, чтобы сортировать файлы, большие, чем память, что наивное script - в awk, python или оболочка - как правило, не будет), вы можете сделать это таким образом, который будет работать в более старых версиях (я ожидаю, что следующее будет работать через Bash 2.0):

#!/bin/bash
read cur_key cur_value
while read key value; do
  if [[ $key = "$cur_key" ]] ; then
    cur_value=$(( cur_value + value ))
  else
    printf "%s %s\n" "$cur_key" "$cur_value"
    cur_key="$key"
    cur_value="$value"
  fi
done
printf "%s %s\n" "$cur_key" "$cur_value"

Ответ 3

Этот однострочный Perl, похоже, выполняет эту работу:

perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile

Ответ 4

Один из способов: perl:

perl -ane '
    next unless @F == 2; 
    $h{ $F[0] } += $F[1]; 
    END { 
        printf qq[%s %d\n], $_, $h{ $_ } for sort keys %h;
    }
' infile

Содержимое infile:

a 23
b 8
a 22
b 1

Вывод:

a 45
b 9

Ответ 5

С GNU awk (версии менее 4):

WHINY_USERS= awk 'END {
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

С GNU awk >= 4:

awk 'END {
  PROCINFO["sorted_in"] = "@ind_str_asc"
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile