Николай Игнатушко проверил на GNU sed version 4.2.1 в дистрибутиве Gentoo все команды, упомянутые в этой статье. Не все скрипты хорошо отрабатывали на версии GNU sed. Но дело касалось мелочей, которые исправлены. Только скрипт по замене hill на mountains пришлось существенно переделать.
Добро пожаловать во вторую часть нашей серии, которая посвящена sed, версии GNU. Существует несколько версий sed, которые доступны на разных платформах, но мы сфокусируемся на GNU sed версии 4.x. Многие из вас слышали о sed, или уже использовали его, скорее всего в качестве инструмента замены. Но это только одно из предназначений sed, и мы постараемся показать вам все аспекты использования этой утилиты. Его название расшифровывается как "Stream EDitor" и слово "stream" (поток) в данном случае может означать файл, канал, или просто stdin. Мы надеемся, что у вас уже есть базовые знания о Linux, а если вы уже работали с регулярными выражениями, или по крайней мере знаете, что это такое, то все для вас будет намного проще. Объем статьи не позволяет включить в нее полное руководство по регулярным выражениям, вместо этого мы озвучим базовые концепции и дадим большое количество примеров использования sed.
Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:
$ sed --version
В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.
Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.
Так как команды (скрипты) sed для многих остаются загадкой, мы чувствуем, что наши читатели должны понимать базовые концепции, а не слепо копировать и вставлять команды, значения которых они не понимают. Когда человек хочет понять, что представляют собой регулярные выражения, ключевым словом является "соответствие", или, точнее, "шаблон соответствия". Например, в отчете для своего департамента вы написали имя Nick, обращаясь к сетевому архитектору. Но Nick ушел, а на его место пришел John, поэтому теперь вы должны заменить слово Nick на John. Если файл с отчетом называется report.txt, вы должны выполнить следующую команду:
$ cat report.txt | sed "s/Nick/John/g" > report_new.txt
По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:
$ sed "s/Nick/John/g" report.txt > report_new.txt
Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо
использовать команду sed "s/Nick|nick/John/g". Вертикальная черта имеет значение, которое вы должны
знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите
ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы,
широко использующиеся в регулярных выражениях - это "?", который соответствует повторению
предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour),
"*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.
Синтаксис команды | Описание |
Sed "s/Nick/John/g" report.txt |
Заменяет каждое вхождение Nick на John в файле report.txt |
Sed "s/Nick\|nick/John/g" report.txt |
Заменяет каждое вхождение Nick или nick на John. |
Sed "s/^/ /" file.txt > file_new.txt |
Добавляет 8 пробелов слева от текста для улучшения качества печати. |
Sed -n "/Of course/,/attention you pay/p" myfile |
Выводит все абзацы, начинающиеся с "Of course" и заканчивающиеся на "attention you pay". |
Sed -n 12,18p file.txt |
Выводит только строки 12-18 файла file.txt |
Sed 12,18d file.txt |
Выводит весь файл file.txt за исключением строк с 12 по 18 |
Вставляет пустую строку после каждой строки в file.txt | |
Sed -f script.sed file.txt |
Записывает все команды в script.sed и выполняет их. |
Sed "5!s/ham/cheese/" file.txt |
Заменяет ham на cheese в file.txt за исключением 5-й строки |
Sed "$d" file.txt |
Удаляет последнюю строку |
Sed -n "/\{3\}/p" file.txt |
Печатает только строки с тремя последовательными цифрами |
Sed "/boom/s/aaa/bb/" file.txt |
Если найден "boom", заменить aaa на bb |
Sed "17,/disk/d" file.txt |
Удаляет все строки, начиная с 17-й, до "disk". Если строк с "disk" несколько, удаляет до первой из них. |
Echo ONE TWO | sed "s/one/unos/I" |
Заменяет one на unos независимо от регистра, поэтому будет напечатано "unos TWO" |
Sed "G;G" file.txt |
Вставляет две пустые строки после каждой строки в file.txt |
Sed "s/.$//" file.txt |
Способ замены dos2unix:). В общем случае удаляет последний символ в каждой строке. |
Sed "s/^[ \t]*//" file.txt |
Удаляет все пробелы/табы перед каждой строкой в file.txt |
Sed "s/[ \t]*$//" file.txt |
Удаляет все пробелы/табы в конце каждой строки в file.txt |
Sed "s/^[ \t]*//;s/[ \t]*$//" file.txt |
Удаляет все пробелы/табы в начале и в конце каждой строки в file.txt |
Sed "s/foo/bar/" file.txt |
Заменяет foo на bar только в первом вхождении в строке. |
Sed "s/foo/bar/4" file.txt |
Заменяет foo на bar только в четвертом вхождении в строке. |
Sed "s/foo/bar/g" file.txt |
Заменяет foo на bar для всех вхождений в строке. |
Sed "/baz/s/foo/bar/g" file.txt |
Заменить foo на bar только если строка содержит baz. |
Sed "/./,/^$/!d" file.txt |
Сжать все последовательные пустые строки до одной. Пустой строки сверху не остается. |
Sed "/^$/N;/\n$/D" file.txt |
Сжать все последовательные пустые строки до одной, но оставить верхнюю пустую строку. |
Sed "/./,$!d" file.txt |
Удалить все начальные пустые строки |
Sed -e:a -e "/^\n*$/{$d;N;};/\n$/ba" file.txt |
Удалить все замыкающие пустые строки |
Sed -e:a -e "/\\$/N; s/\\\n/ /; ta" file.txt |
Если строка заканчивается обратным сплешем, соединить ее со следующей (полезно для скриптов оболочки) |
Sed -n "/regex/,+5p" file.txt |
Выводит 5 строк после строки содержащей regex |
Sed "1~3d" file.txt |
Удалить каждую третью строку, начиная с первой. |
Sed -n "2~5p" file.txt |
Печатать каждую пятую строку, начиная со второй. |
Sed "s/ick/John/g" report.txt |
Другой способ записи некоторых приведенных выше примеров. Вы можете предложить свой? |
Sed -n "/RE/{p;q;}" file.txt |
Печатает строку с первым соответствием RE (регулярного выражения) |
Sed "0,/RE/{//d;}" file.txt |
Удаляет строку с первым соответствием |
Sed "0,/RE/s//to_that/" file.txt |
Изменяет только первое соответствие |
Sed "s/^[^,]*,/9999,/" file.csv |
Заменяет на 9999 все значения в первой колонке CSV-файла |
S/^ *\(.*[^ ]\) *$/|\1|/; s/" *, */"|/g; : loop s/| *\([^",|][^,|]*\) *, */|\1|/g; s/| *, */||/g; t loop s/ *|/|/g; s/| */|/g; s/^|\(.*\)|$/\1/; |
Скрипт sed для конвертирования CSV-файла в файл с вертикальной чертой в качестве разделителя (работает только с некоторыми типами CSV, со встроенными кавычками и запятыми). |
Sed ":a;s/\(^\|[^0-9.]\)\(\+\)\(\{3\}\)/\1\2,\3/g;ta" file.txt |
Меняет формат чисел в file.txt с 1234.56 на 1.234.56 |
Sed -r "s/\<(reg|exp)+/\U&/g" |
Переводит любое слово, начинающееся с reg или exp в верхний регистр. |
Sed "1,20 s/Johnson/White/g" file.txt |
Производит замену Johnson на White только в строках 1 - 20. |
Sed "1,20 !s/Johnson/White/g" file.txt |
Предыдущий пример наоборот (заменяет везде, кроме строк 1-20) |
Sed "/from/,/until/ { s/\<red\>/magenta/g; s/<blue\>/cyan/g; }" file.txt |
Заменяет только между "from" и "until". Если областей "from"-"until" несколько, заменяет в каждой из них. |
Sed "/ENDNOTES:/,$ { s/Schaff/Herzog/g; s/Kraft/Ebbing/g; }" file.txt |
Заменяет только со слова "ENDNOTES:" и до EOF |
Sed "/./{H;$!d;};x;/regex/!d" file.txt |
Печатает абзац только если он содержит regex |
Sed -e "/./{H;$!d;}" -e "x;/RE1/!d;/RE2/!d;/RE3/!d" file.txt |
Печатает абзацы только если они содержат RE1, RE2 и RE3. Порядок RE1, RE2 и RE3 не имеет значения. |
Sed "s/14"/fourteen inches/g" file.txt |
Так вы сможете использовать двойные кавычки |
Sed "s/\/some\/UNIX\/path/\/a\/new\/path/g" file.txt |
Работа с путями Unix |
Sed "s///g" file.txt |
Удаляет все символы, начиная с a и заканчивая g из файла file.txt |
Sed "s/\(.*\)foo/\1bar/" file.txt |
Заменяет только последнее в строке соответствие foo на bar |
Sed "1!G;h;$!d" |
Замена команды tac |
Sed "/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//" |
Замена команды rev |
Sed 10q file.txt |
Замена команды head |
Sed -e:a -e "$q;N;11,$D;ba" file.txt |
Замена команды tail |
Sed "$!N; /^\(.*\)\n\1$/!P; D" file.txt |
Замена команды uniq |
Sed "$!N; s/^\(.*\)\n\1$/\1/;t; D" file.txt |
Обратная команда (что эквивалентно uniq -d) |
Sed "$!N;$!D" file.txt |
Эквивалент tail -n 2 |
Sed -n "$p" file.txt |
... tail -n 1 (или tail -1) |
Sed "/regexp/!d" file.txt |
Эквивалент grep |
Sed -n "/regexp/{g;1!p;};h" file.txt |
Печатает строку, находящуюся перед первым соответствием регулярному выражению, но не включающую само соответствие |
Sed -n "/regexp/{n;p;}" file.txt |
Печатает строку, находящуюся после первого соответствия регулярному выражению, но не включающую само соответствие |
Sed "/pattern/d" file.txt |
Удаляет строки, соответствующие шаблону pattern |
Sed "/./!d" file.txt |
Удаляет все пустые строки из файла |
Sed "/^$/N;/\n$/N;//D" file.txt |
Сжимает все последовательные пустые строки до двух пустых. Одинарные пустые строки не изменяются. |
Sed -n "/^$/{p;h;};/./{x;/./p;}" file.txt |
Удаляет последнюю строку каждого абзаца |
Получает заголовок письма. Другими словами - удаляет все после первой пустой строки. | |
Редактор потоков sed – это неинтерактивный текстовый редактор, выполняющий операции на данных, поступающих из стандартного ввода или из файла. Sed редактирует информацию построчно.
В были описаны основы работы с редактором sed. Данное руководство охватывает более продвинутые приёмы.
Иногда возникает необходимость передать редактору sed несколько команд одновременно. Это делается несколькими способами.
Если у вас ещё нет тестового файла для работы с sed, создайте следующее окружение:
cd
cp /usr/share/common-licenses/BSD .
cp /usr/share/common-licenses/GPL-3 .
echo "this is the song that never ends
not knowing what it was
just because..." > annoying.txt
Поскольку sed работает со стандартным вводом и выводом, можно, конечно, просто вызвать различные команды sed вместе в одной строке:
sed "s/and/\&/" annoying.txt | sed "s/people/horses/"
yes, it goes on & on, my friend
some horses started singing it
not knowing what it was
& they"ll continue singing it forever
just because...
Такой метод сработает, но несколько вызовов sed создают излишнюю нагрузку, занимают больше места и не используют встроенных возможностей sed.
Передать sed несколько команд одновременно можно при помощи опции –e, которую нужно вставить перед каждой командой:
sed -e "s/and/\&/" -e "s/people/horses/" annoying.txt
Также можно объединить команды в строку при помощи символа точки с запятой. Этот метод работает точно так же как и предыдущий.
sed "s/and/\&/;s/people/horses/" annoying.txt
Обратите внимание: при использовании флага –e возникает необходимость разрывать одиночные кавычки, а при использовании точки с запятой все команды можно перечислить в одних кавычках.
Эти два способа одновременного вызова нескольких команд достаточно удобны, однако бывают случаи, когда требуется использовать простую строку команд.
Также следует ознакомиться с оператором =. Этот оператор вставляет номер строки между каждой существующей строкой. Результат выглядит следующим образом:
sed "=" annoying.txt
1
this is the song that never ends
2
yes, it goes on and on, my friend
3
some people started singing it
4
not knowing what it was
5
and they"ll continue singing it forever
6
just because...
Теперь попробуйте отредактировать текст, чтобы понять, как меняется формат нумерации.
Команда G по умолчанию добавляет пустую строку между уже существующими строками.
sed "G" annoying.txt
_
this is the song that never ends
_
yes, it goes on and on, my friend
_
some people started singing it
_
not knowing what it was
_
and they"ll continue singing it forever
_
just because...
Попробуйте скомбинировать эти две команды. Сначала может показаться, что вывод этих команд будет содержать пустую строку между строкой текста и строкой с номером. Однако вывод выглядит так:
sed "=;G" annoying.txt
1
this is the song that never ends
_
2
yes, it goes on and on, my friend
_
3
some people started singing it
_
4
not knowing what it was
. . .
. . .
Это происходит потому, что оператор = изменяет поток вывода (это значит, что использовать полученный вывод для дальнейшего редактирования нельзя).
Это можно обойти при помощи двух вызовов sed, где первый вызов будет восприниматься как простой поток текста для второго.
sed "=" annoying.txt | sed "G"
1
_
this is the song that never ends
_
2
_
yes, it goes on and on, my friend
_
3
_
some people started singing it
. . .
. . .
Имейте в виду, некоторые из команд работают аналогичным образом, особенно если вы объединяете несколько команд и вывод отличается от ожидаемого.
Одним из преимуществ команд sed, поддерживающих адресацию, является то, что они могут использовать регулярные выражения в качестве критериев. Это означает, что можно работать с файлами, содержимое которых точно не известно.
sed "1,3s/.*/Hello/" annoying.txt
Hello
Hello
Hello
not knowing what it was
and they"ll continue singing it forever
just because...
Вместо этого можно использовать регулярное выражение, находящее только строки, содержащие определенный шаблон. Для этого нужно поместить шаблон поиска между двумя слешами (/) перед командой.
sed "/singing/s/it/& loudly/" annoying.txt
this is the song that never ends
yes, it goes on and on, my friend
some people started singing it loudly
not knowing what it was
and they"ll continue singing it loudly forever
just because...
В этом примере слово loudly помещается перед первым it в каждой строке, содержащей слово singing. Обратите внимание: вторая и четвёртая строки остались без изменений, поскольку они не отвечают шаблону.
Выражения для адресации можно усложнить. Это делает команды более гибкими.
Следующий пример демонстрирует, как использовать регулярные выражения для генерации адресов для других команд. Эта команда находит все пустые строки и удаляет их:
sed "/^$/d" GPL-3
GNU GENERAL PUBLIC LICENSE
Version 3, 29 June 2007
Copyright (C) 2007 Free Software Foundation, Inc.
Everyone is permitted to copy and distribute verbatim copies
of this license document, but changing it is not allowed.
Preamble
The GNU General Public License is a free, copyleft license for
. . .
. . .
Имейте в виду, что регулярные выражения могут быть использованы в любой части диапазона.
К примеру, можно удалить строки между строками START и END:
sed "/^START$/,/^END$/d" inputfile
Имейте в виду: эта команда удалит все строки от первого найденного слова START до первого найденного слова END, и если затем она снова встретит слово START, она продолжит удалять данные.
Чтобы инвертировать адресацию (то есть выбрать строки, которые не соответствуют шаблону), используйте восклицательный знак (!).
К примеру, чтобы удалить любую заполненную строку, нужно ввести:
sed "/^$/!d" GPL-3
Адрес не обязательно должен быть сложным выражением, чтобы быть инвертированным. Инверсия точно так же работает с обычной нумерацией.
Дополнительный буфер (hold buffer) увеличивает способность sed выполнять многострочное редактирование.
Дополнительный буфер представляет собой область временного хранения, которая может быть изменена путем определенных команд.
Наличие этого дополнительного буфера позволяет хранить строки во время работы над другими строками.
Команды для работы с буфером:
С контентом дополнительного буфера нельзя работать до тех пор, пока он не перемещён в буфер обработки.
Рассмотрим сложный пример.
Попробуйте соединить смежные строки при помощи следующей команды:
sed -n "1~2h;2~2{H;g;s/\n/ /;p}" annoying.txt
Примечание : На самом деле, для этого sed предлагает отдельную встроенную команду N; но для практики рассмотреть этот пример полезно.
Опция –n подавляет автоматический вывод.
1~2h – определение адреса, выполняющее последовательную замену каждой второй строки текста, начина с первой (то есть каждой нечётной строки). Команда h копирует совпавшие строки в дополнительный буфер.
Остальная часть команды взята в фигурные скобки. Это означает, что эта часть команды будут наследовать адрес, который был только что указан. Без этих скобок, наследовать адрес будет только команда H, а остальные команды будут выполняться для каждой строки.
Конечно, ранее упомянутая встроенная команда N значительно короче и проще, и возвращает такой же результат:
sed -n "N;s/\n/ /p" annoying.txt
this is the song that never ends yes, it goes on and on, my friend
some people started singing it not knowing what it was
and they"ll continue singing it forever just because...
Команды можно компоновать в скрипты. Это позволяет выполнять целый набор команд на один целевой шаблон.
К примеру, можно написать скрипт, чтобы создавать простые текстовые сообщения, которые нужно предварительно отформатировать.
Тогда вам не придётся постоянно повторять одни и те же команды для каждого сообщения. По сути, скрипт sed – это список команд, которые нужно применить на заданный объект.
Например:
s/this/that/g
s/snow/rain/g
1,5s/pinecone/apricot/g
Затем можно вызвать файл:
sed -f sedScriptName fileToEdit
Теперь вы знаете более продвинутые методы работы с sed.
Сначала команды sed сложны для понимания, в них легко запутаться. Потому рекомендуется поэкспериментировать с ними, прежде чем использовать их на важных данных.
Tags: ,В прошлый раз мы говорили о функциях в bash-скриптах, в частности, о том, как вызывать их из командной строки. Наша сегодняшняя тема - весьма полезный инструмент для обработки строковых данных - утилита Linux, которая называется sed. Её часто используют для работы с текстами, имеющими вид лог-файлов, конфигурационных и других файлов.
Если вы, в bash-скриптах, каким-то образом обрабатываете данные, вам не помешает знакомство с инструментами sed и gawk. Тут мы сосредоточимся на sed и на работе с текстами, так как это - очень важный шаг в нашем путешествии по бескрайним просторам разработки bash-скриптов.
Сейчас мы разберём основы работы с sed, а так же рассмотрим более трёх десятков примеров использования этого инструмента.
$ sed options file
По умолчанию sed применяет указанные при вызове правила, выраженные в виде набора команд, к STDIN . Это позволяет передавать данные непосредственно sed.
Например, так:
$ echo "This is a test" | sed "s/test/another test/"
Вот что получится при выполнении этой команды.
В данном случае sed заменяет слово «test» в строке, переданной для обработки, словами «another test». Для оформления правила обработки текста, заключённого в кавычки, используются прямые слэши. В нашем случае применена команда вида s/pattern1/pattern2/ . Буква «s» - это сокращение слова «substitute», то есть - перед нами команда замены. Sed, выполняя эту команду, просмотрит переданный текст и заменит найденные в нём фрагменты (о том - какие именно, поговорим ниже), соответствующие pattern1 , на pattern2 .
Выше приведён примитивный пример использования sed, нужный для того, чтобы ввести вас в курс дела. На самом деле, sed можно применять в гораздо более сложных сценариях обработки текстов, например - для работы с файлами.
Ниже показан файл, в котором содержится фрагмент текста, и результаты его обработки такой командой:
$ sed "s/test/another test" ./myfile
Здесь применён тот же подход, который мы использовали выше, но теперь sed обрабатывает текст, хранящийся в файле. При этом, если файл достаточно велик, можно заметить, что sed обрабатывает данные порциями и выводит то, что обработано, на экран, не дожидаясь обработки всего файла.
Sed не меняет данные в обрабатываемом файле. Редактор читает файл, обрабатывает прочитанное, и отправляет то, что получилось, в STDOUT . Для того, чтобы убедиться в том, что исходный файл не изменился, достаточно, после того, как он был передан sed, открыть его. При необходимости вывод sed можно перенаправить в файл, возможно - перезаписать старый файл. Если вы знакомы с одним из предыдущих материалов этой серии, где речь идёт о перенаправлении потоков ввода и вывода, вы вполне сможете это сделать.
$ sed -e "s/This/That/; s/test/another test/" ./myfile
К каждой строке текста из файла применяются обе команды. Их нужно разделить точкой с запятой, при этом между окончанием команды и точкой с запятой не должно быть пробела.
Для ввода нескольких шаблонов обработки текста при вызове sed, можно, после ввода первой одиночной кавычки, нажать Enter, после чего вводить каждое правило с новой строки, не забыв о закрывающей кавычке:
$ sed -e "
> s/This/That/
> s/test/another test/" ./myfile
Вот что получится после того, как команда, представленная в таком виде, будет выполнена.
Вот содержимое файла mycommands:
S/This/That/
s/test/another test/
Вызовем sed, передав редактору файл с командами и файл для обработки:
$ sed -f mycommands myfile
Результат при вызове такой команды аналогичен тому, который получался в предыдущих примерах.
$ sed "s/test/another test/" myfile
Вот что содержится в файле, и что будет получено после его обработки sed.
Команда замены нормально обрабатывает файл, состоящий из нескольких строк, но заменяются только первые вхождения искомого фрагмента текста в каждой строке. Для того, чтобы заменить все вхождения шаблона, нужно использовать соответствующий флаг.
Схема записи команды замены при использовании флагов выглядит так:
S/pattern/replacement/flags
Выполнение этой команды можно модифицировать несколькими способами.
$ sed "s/test/another test/2" myfile
Вызов команды замены с указанием позиции заменяемого фрагмента
Тут мы указали, в качестве флага замены, число 2. Это привело к тому, что было заменено лишь второе вхождение искомого шаблона в каждой строке. Теперь опробуем флаг глобальной замены - g:
$ sed "s/test/another test/g" myfile
Как видно из результатов вывода, такая команда заменила все вхождения шаблона в тексте.
Флаг команды замены p позволяет выводить строки, в которых найдены совпадения, при этом ключ -n , указанный при вызове sed, подавляет обычный вывод:
$ sed -n "s/test/another test/p" myfile
Как результат, при запуске sed в такой конфигурации на экран выводятся лишь строки (в нашем случае - одна строка), в которых найден заданный фрагмент текста.
Воспользуемся флагом w , который позволяет сохранить результаты обработки текста в файл:
$ sed "s/test/another test/w output" myfile
Хорошо видно, что в ходе работы команды данные выводятся в STDOUT , при этом обработанные строки записываются в файл, имя которого указано после w .
$ sed "s/\/bin\/bash/\/bin\/csh/" /etc/passwd
Однако, выглядит всё это не очень-то хорошо. Всё дело в том, что так как прямые слэши используются в роли символов-разделителей, такие же символы в передаваемых sed строках приходится экранировать. В результате страдает читаемость команды.
К счастью, sed позволяет нам самостоятельно задавать символы-разделители для использования их в команде замены. Разделителем считается первый символ, который будет встречен после s:
$ sed "s!/bin/bash!/bin/csh!" /etc/passwd
В данном случае в качестве разделителя использован восклицательный знак, в результате код легче читать и он выглядит куда опрятнее, чем прежде.
$ sed "2s/test/another test/" myfile
Второй вариант - диапазон строк:
$ sed "2,3s/test/another test/" myfile
Кроме того, можно вызвать команду замены так, чтобы файл был обработан начиная с некоей строки и до конца:
$ sed "2,$s/test/another test/" myfile
Для того, чтобы обрабатывать с помощью команды замены только строки, соответствующие заданному фильтру, команду надо вызвать так:
$ sed "/likegeeks/s/bash/csh/" /etc/passwd
По аналогии с тем, что было рассмотрено выше, шаблон передаётся перед именем команды s .
Тут мы использовали очень простой фильтр. Для того, чтобы в полной мере раскрыть возможности данного подхода, можно воспользоваться регулярными выражениями. О них мы поговорим в одном из следующих материалов этой серии.
Вызов команды выглядит так:
$ sed "3d" myfile
Мы хотим, чтобы из текста была удалена третья строка. Обратите внимание на то, что речь не идёт о файле. Файл останется неизменным, удаление отразится лишь на выводе, который сформирует sed.
Если при вызове команды d не указать номер удаляемой строки, удалены будут все строки потока.
Вот как применить команду d к диапазону строк:
$ sed "2,3d" myfile
А вот как удалить строки, начиная с заданной - и до конца файла:
$ sed "3,$d" myfile
Строки можно удалять и по шаблону:
$ sed "/test/d" myfile
При вызове d можно указывать пару шаблонов - будут удалены строки, в которых встретится шаблон, и те строки, которые находятся между ними:
$ sed "/second/,/fourth/d" myfile
$ echo "Another test" | sed "i\First test "
Теперь взглянем на команду a:
$ echo "Another test" | sed "a\First test "
Как видно, эти команды добавляют текст до или после данных из потока. Что если надо добавить строку где-нибудь посередине?
Тут нам поможет указание номера опорной строки в потоке, или шаблона. Учтите, что адресация строк в виде диапазона тут не подойдёт. Вызовем команду i , указав номер строки, перед которой надо вставить новую строку:
$ sed "2i\This is the inserted line." myfile
Проделаем то же самое с командой a:
$ sed "2a\This is the appended line." myfile
Обратите внимание на разницу в работе команд i и a . Первая вставляет новую строку до указанной, вторая - после.
$ sed "3c\This is a modified line." myfile
Если воспользоваться при вызове команды шаблоном в виде обычного текста или регулярного выражения, заменены будут все соответствующие шаблону строки:
$ sed "/This is/c This is a changed line of text." myfile
$ sed "y/123/567/" myfile
Используя эту команду, нужно учесть, что она применяется ко всему текстовому потоку, ограничить её конкретными вхождениями символов нельзя.
$ sed "=" myfile
Потоковый редактор вывел номера строк перед их содержимым.
Если передать этой команде шаблон и воспользоваться ключом sed -n , выведены будут только номера строк, соответствующих шаблону:
$ sed -n "/test/=" myfile
Рассмотрим пример:
$ sed "3r newfile" myfile
Тут содержимое файла newfile было вставлено после третьей строки файла myfile .
Вот что произойдёт, если применить при вызове команды r шаблон:
$ sed "/test/r newfile" myfile
Содержимое файла будет вставлено после каждой строки, соответствующей шаблону.
Решить эту задачу можно, воспользовавшись командами r и d потокового редактора sed:
$ Sed "/DATA>/ {
r newfile
d}" myfile
Как видите, вместо заполнителя DATA sed добавил в выходной поток две строки из файла data .
На сегодня это всё. В следующий раз поговорим о языке обработки данных awk.
Уважаемые читатели! А вы пользуетесь sed в повседневной работе? Если да - поделитесь пожалуйста опытом.
Команда sed - это редактор потока данных (Stream EDitor) для автоматического редактирования текстов. "Редактор потока" - в том смысле, что может редактировать входящий поток данных непрерывно, скажем, в составе программного канала (pipe). Автоматически - это значит, что, как только вы зададите правила редактирования, дальнейшее происходит без вашего утомительного участия. Другими словами, редактор sed не является интерактивным.
Программа sed сложнее, чем те команды, что мы уже успели рассмотреть в предыдущих статьях цикла HuMan. В ее составе арсенал собственных команд, поэтому, дабы избежать тавтологии и путаницы, в этой статье команда sed впредь будет именоваться "программой" или "редактором", а команды редактора sed - просто командами.
Программа sed способна выполнять сложные задания, и нужно потратить время, чтобы научиться эти задания формулировать.
Но наряду со сложными действиями, у команды sed есть простые, но весьма полезные возможности, освоить которые не труднее, чем прочие команды Юникс. Не позволяйте себе из-за сложности освоения всей программы, отказываться от ее простых аспектов.
Мы начнем от простого к сложному, так что вы всегда сможете понять, где следует остановиться.
Программа sed имеет множество собственных команд. Большинство пользователей знают только команду s, и этого вполне хватает, чтобы работать с редактором sed. Команда s заменяет ОБРАЗЕЦ на ЗАМЕНУ:
sed s/ОБРАЗЕЦ/ЗАМЕНА/
$ echo день | sed s/день/ночь/ (Enter) ночь
Проще не бывает. А вот пример с вводом из файла zar.txt:
По утрам он делал зарядку. Молния - электрический заряд. $ sed s/заряд/разряд/ zar.txt По утрам он делал разрядку. Молния - электрический разряд.
Я не брал выражение s/ОБРАЗЕЦ/ЗАМЕНУ/ в кавычки, так как данный пример не нуждается в кавычках, но если бы в нем присутствовали метасимволы, то кавычки были бы обязательны. Чтобы не ломать себе каждый раз голову, и не ошибиться ненароком, всегда ставьте кавычки, лучше более "сильные" одинарные, это хорошая привычка. Кашу маслом не испортишь. Я тоже во всех последующих примерах не буду манкировать кавычками.
Как мы видим, заменяющая команда s имеет четыре составляющих:
S сама команда /.../.../ разделитель ОБРАЗЕЦ образец для поиска и последующей замены ЗАМЕНА выражение, которое заменит собой ОБРАЗЕЦ, буде таковой найден.
Прямой слэш (/) используется в качестве разделителя по традиции, так как предок программы sed - редактор ed использует их (как и редактор vi). В некоторых случаях такой разделитель весьма неудобен, например, когда надо менять пути (path) к директориям, которые тоже содержат прямой слэш (/usr/local/bin). В этом случае приходится разделять прямые слэши обратными:
Sed "s/\/usr\/local\/bin/\/common\/bin/"
Это называется "частокол" и выглядит весьма уродливо, а главное, непонятно.
Уникальность программы sed в том, что она позволяет использовать любой разделитель, например знак подчеркивания:
$ echo день | sed s_день_ночь_ ночь
или двоеточие:
$ echo день | sed s:день:ночь: ночь
Если в поисках разделителя, который вам нравится, вы получаете сообщение "незавершенная команда `s"", значит этот символ не годится в качестве разделителя, или вы просто забыли поставить один-два разделителя.
В этой статье я вынужден использовать традиционный разделитель (/) чтобы не сбивать читателя с толку, но в случае необходимости стану использовать в качестве разделителя тильду (~).
(Regular expressions, regexp, RE)
Тема регулярных выражений настолько обширна, что ей посвящены целые книги (смотри ссылки в конце статьи). Тем не менее, говорить всерьез о редакторе sed, не применяя регулярных выражений, также непродуктивно, как разговаривать о тригонометрии при помощи счетных палочек. Поэтому необходимо рассказать хотя бы о тех регулярных выражениях, которые часто используются с программой sed.
с Или любая другая буква. Большинство букв, цифр и прочих неспециальных символов считаются регулярными выражениями, представляющими сами себя.
* Астериск, следующий за каким-либо символом или регулярным выражением, означает любое число (в том числе и нулевое) повторов этого символа или регулярного выражения.
\+ Означает один или более повтор символа или регулярного выражения.
\? Означает ни одного или один повтор.
\{i\} Означает ровно i повторов.
\{i,j\} Число повторов находится в интервале от i до j включительно.
\{i,\} Число повторов больше или равно i.
\{,j\ } Число повторов меньше или равно j.
\(RE\ ) Запомнить регулярное выражение или его часть с целью дальнейшего использования как единое целое. Например, \(а-я\)* будет искать любое сочетание любого количества (в том числе и нулевого) строчных букв.
. Означает любой символ, в том числе символ новой строки.
^ Означает нулевое выражение в начале строки. Другими словами, то, перед чем стоит этот знак, должно появляться в начале строки. Например, ^#include будет искать строки, начинающиеся с #include.
$ То же, что и предыдущее, только относится к концу строки.
[СПИСОК] Означает любой символ из СПИСКА. Например, будет искать любую английскую гласную букву.
[^СПИСОК] Означает любой символ, кроме тех, что в списке. Например, [^aeiou] будет искать любую согласную. Примечание: СПИСОК может быть интервалом, например [а-я], что будет означать любую строчную букву. Если нужно включить в СПИСОК ] (квадратную скобку) укажите ее в списке первой; если нужно включить в СПИСОК - (дефис), то укажите его в списке первым или последним.
RE1\|RE2 Означает РВ1 или РВ2.
RE1RE2 Означает объединение регулярных выражений РВ1 и РВ2.
\n Означает символ новой строки.
\$; \*; \.; \[; \\; \^ Означают соответственно: $; *; .; [; \; ^
Внимание: Остальные условные обозначения на основе обратного слэша (\), принятые в языке С, не поддерживаются программой sed.
\1 \2 \3 \4 \5 \6 \7 \8 \9 Означает соответствующую по счету часть регулярного выражения, запомненную при помощи знаков \(и \).
Несколько примеров:
abcdef Означает abcdef
a*b Означает ноль или любое количество букв а и одна буква b. Например, aaaaaab; ab; или b.
a\?b Означает b или ab
a\+b\+ Означает одну или больше букв а и одну или больше букв b. Например: ab; aaaab; abbbbb; или aaaaaabbbbbbb.
.* Означает все символы на строке, на всех строках, включая пустые.
.\+ Означает все символы на строке, но только на строках, содержащих хотя бы один символ. Пустые строки не соответствуют данному регулярному выражению.
^main.*(.*) Будет искать строки, начинающиеся со слова main, а также имеющие в своем составе открывающую и закрывающие скобки, причем перед и после открывающей скобки может находиться любое количество символов (а может и не находиться).
^# Будет искать строки, начинающиеся со знака # (например комментарии).
\\$ Будет искать строки, заканчивающиеся обратным слэшем (\).
Любые буквы или цифры
[^ ]\+ (В квадратной скобке, кроме символа ^, содержится еще пробел и табуляция) --Означает один или любое количество любых символов, кроме пробела и табуляции. Обычно имеется в виду слово.
^.*A.*$ Означает заглавную букву А точно в середине строки.
A.\{9\}$ Означает заглавную букву А, точно десятую по счету от конца строки.
^.\{,15\}A Означает заглавную букву А, точно шестнадцатую по счету от начала строки.
Теперь, когда мы познакомились с некоторыми регулярными выражениями, вернемся к команде s редактора sed.
Использование символа & когда ОБРАЗЕЦ неизвестен "Как это неизвестен?", - спросите вы - "Ты разве не знаешь, что хочешь заменить?" Отвечу: я хочу взять в скобки любые цифры, найденные в тексте. Как это сделать? Ответ: применить символ &.
Символ & (амперсанд), будучи помещен в состав ЗАМЕНЫ, означает любой найденный в тексте ОБРАЗЕЦ. Например:
$ echo 1234 | sed "s/*/(&)/" (1234)
Звездочка (астериск) после интервала нужна чтобы заменены были все цифры, встретившиеся в образце. Без нее получилось бы:
$ echo 1234 | sed "s//(&)/" (1)234
То есть в качестве образца взята была первая же найденная цифра.
Вот пример со вполне осмысленной нагрузкой: составим файл formula.txt:
A+432-10=n
и применим к нему команду:
$ sed "s/*-*/(&)/" formula.txt a+(432-10)=n
Математическая формула приобрела однозначный смысл.
Еще символ амперсанда можно использовать для удвоения ОБРАЗЦА:
$ echo 123 | sed "s/*/& &/" 123 123
Тут есть одна тонкость. Если мы чуть усложним пример:
$ echo "123 abc" | sed "s/*/& &/" 123 123 abc
как и следовало ожидать, удваиваются только цифры, так как в ОБРАЗЦЕ нет букв. Но если мы поменяем части текста местами:
$ echo "abc 123" | sed "s/*/& &/" abc 123
то никакого удвоения цифр не получится. Это особенность регулярного выражения * - оно ищет соответствия только в первом символе строки. Если мы хотим удвоения цифр, где бы они ни находились, нужно доработать регулярное выражение в ЗАМЕНЕ:
$ echo "abc defg 123" | sed "s/*/& &/" abc defg 123 123
тогда цифры будут удваиваться, независимо от количества предшествующих "слов".
Использование условных знаков \(, \) и \1 для обработки части ОБРАЗЦА Условные знаки \(и \) (escaped parentheses) применяются для запоминания части регулярного выражения.
Условный знак \1 означает первую запомненную часть, \2 - вторую, и так далее, вплоть до девяти запомненных частей (больше программа не поддерживает). Разберем пример:
$ echo abcd123 | sed "s/\(*\).*/\1/" abcd
Здесь \(*\) означает, что программа должна запомнить все буквенные символы в любом количестве; .* означает любое количество символов после первой запомненной части; а \1 означает, что мы хотим видеть только первую запомненную часть. Так и есть: в выводе программы мы видим только буквы и никаких цифр.
Для того, чтобы поменять слова местами, нужно запомнить два суб-ОБРАЗЦА, а потом поменять их местами:
$ echo глупый пингвин |sed "s/\([а-я]*\) \([а-я]*\)/\2 \1/" пингвин глупый
Здесь \2 означает второй суб-ОБРАЗЕЦ, а \1 -первый. Обратите внимание на интервал между первым выражением \([а-я]*\) и вторым выражением \([а-я]*\). Он необходим, чтобы были найдены два слова.
Знак \1 вовсе не обязан быть только в ЗАМЕНЕ, он может присутствовать также и в ОБРАЗЦЕ, например, когда мы хотим удалить дубликаты слов:
$ echo пингвин пингвин | sed "s/\([а-я]*\) \1/\1/" пингвин
Модификаторы замены ставятся после последнего разделителя. Эти модификаторы определяют действия программы в случае, если в строке нашлось более одного совпадения с ОБРАЗЦОМ, и каким образом производить замену.
Модификатор /g
Глобальная замена (Global replacement)
Программа sed, как и большинство утилит Юникс, при работе с файлами считывают по одной строке. Если мы приказываем заменить слово, программа заменит только первое совпавшее с ОБРАЗЦОМ слово на данной строке. Если мы хотим изменить каждое слово, совпавшее с образцом, то следует ввести модификатор /g.
Без модификатора /g:
$ echo кот этот, был самый обычный кот | sed "s/кот/котенок/" котенок этот, был самый обычный кот
Редактор заменил только первое совпавшее слово.
А теперь с модификатором глобальной замены:
$ echo кот этот, был самый обычный кот | sed "s/кот/котенок/g" котенок этот, был самый обычный котенок
Все совпадения в данной строке были заменены.
А если нужно изменить все слова, скажем взять их в скобки? Тогда на помощь снова придут регулярные выражения. Чтобы выбрать все буквенные символы, как верхнего, так и нижнего регистра, можно воспользоваться конструкцией [А-Яа-я], но в нее не попадут такие слова как "что-то" или "с"езд". Гораздо удобнее конструкция [^ ]*, которая соответствует всем символам, кроме пробела. Итак:
$ echo глупый пингвин робко прячет | sed "s/[^ ]*/(&)/g" (глупый) (пингвин) (робко) (прячет)
Как выбрать нужное совпадение из нескольких
Если не применять модификаторов, то программа sed заменит только первое совпавшее с ОБРАЗЦОМ слово. Если применить модификатор /g, то программа заменит каждое совпавшее слово. А как можно выбрать одно из совпадений, если их несколько на строке? - При помощи уже знакомых нам условных знаков \(и \) запомнить суб-ОБРАЗЦЫ и выбрать нужный при помощи знаков \1 - \9.
$ echo глупый пингвин | sed "s/\([а-я]*\) \([а-я]*\)/\2 /" пингвин
В этом примере мы запомнили оба слова, и, поставив второе (пингвин) на первое место, первое (глупый) удалили, поставив в секции ЗАМЕНЫ вместо него пробел. Если мы поставим вместо пробела какое-либо слово, то оно заменит первое (глупый):
$ echo глупый пингвин | sed "s/\([а-я]*\) \([а-я]*\)/\2 умный /" пингвин умный
Числовой модификатор
Это одно/двух/трех -значное число, которое ставится после последнего разделителя и указывает, какое по счету совпадение подлежит замене.
$ echo очень глупый пингвин | sed "s/[а-я]*/хороший/2" очень хороший пингвин
В этом примере каждое слово является совпадением, и мы указали редактору, какое по счету слово мы хотим заменить, поставив модификатор 2 после секции ЗАМЕНЫ.
Можно комбинировать цифровой модификатор с модификатором /g. Если нужно оставить неизменным первое слово, а второе и последующие заменить на слово "(удалено)", то команда будет такая:
$ echo очень глупый пингвин | sed "s/[а-я]*/(удалено)/2g" очень (удалено) (удалено)
Если нужно действительно удалить все последующие совпадения, кроме первого, то в секции ЗАМЕНЫ следует поставить пробел:
$ echo очень глупый пингвин | sed "s/[а-я]*/ /2g" очень
Или вовсе ничего не ставить:
$ echo очень глупый пингвин | sed "s/[^ ]*//2g" очень
Числовой модификатор может быть любым целым числом от 1 до 512. Например, если нужно поставить двоеточие после 80 символа каждой строки, то поможет команда:
$ sed "s/./&:/80" имя_файла
Модификатор /p - выдавать на стандартный выход (печатать - print)
Программа sed и так по умолчанию выдает результат на стандартный выход (например экран монитора). Этот модификатор применяется только с опцией sed -n, которая как раз блокирует вывод результата на экран.
Модификатор /w
Позволяет записывать результаты обработки текста в указанный файл:
$ sed "s/ОБРАЗЕЦ/ЗАМЕНА/w имя_файла
Модификатор /e (расширение GNU)
Позволяет указать команду шелла (не программы sed) в качестве ЗАМЕНЫ. Если соответствие ОБРАЗЦУ будет найдено, то оно будет заменено на вывод указанной в секции ЗАМЕНЫ команды. Пример:
$ echo ночь | sed "s/ночь/echo день/e" день
Модификаторы /I и /i (расширение GNU)
Делают процесс замены нечувствительным к регистру символов.
$ echo Night | sed "s/night/day/i" day
Комбинации модификаторов
Модификаторы можно комбинировать, когда это имеет смысл. При этом следует ставить модификатор w последним.
Условные обозначения (расширение GNU ) Их всего пять:
\L переводит символы ЗАМЕНЫ в нижний регистр \l переводит следующий символ ЗАМЕНЫ в нижний регистр \U переводит символы ЗАМЕНЫ в верхний регистр \u переводит следующий символ ЗАМЕНЫ в верхний регистр \E отменяет перевод, начатый \L или \U По очевидным причинам эти условные обозначения применяются по одиночке. Например:
$ echo глупый пингвин | sed "s/глупый/\u&/" Глупый пингвин
$ echo маленький щенок | sed "s/[а-я]*/\u&/2" маленький Щенок
Мы рассмотрели почти все аспекты команды s редактора sed. Теперь настала очередь рассмотреть опции этой программы.
Программа имеет на удивление мало опций. (Что несколько компенсирует избыток команд, модификаторов и прочих функций). Кроме общеизвестных опций --help (-h) и --version (-V), которые мы рассматривать не будем, их всего три:
Опция -e --expression=набор_команд
Один из способов выполнения нескольких команд - применение опции -e. Например:
Sed -e "s/a/A/" -e "s/b/B/" имя_файла
Все предыдущие примеры в этой статье не требовали применения опции -e только потому, что содержали одну команду. Мы могли поставить в примерах опцию -e, это ничего бы не изменило.
Опция -f Если требуется выполнить большое количество команд, то удобнее записать их в файл и применить опцию -f:
Sed -f sedscript имя-файла
Sedscript здесь - имя файла, содержащего команды. Этот файл называется скриптом программы sed (далее просто скрипт). Каждая команда скрипта должна занимать отдельную строку. Например:
# комментарий - Этот скрипт изменит все строчные гласные буквы на заглавные s/a/A/g s/e/E/g s/i/I/g s/o/O/g s/u/U/g
Назвать скрипт можно как угодно, важно не путать файл скрипта с обрабатываемым файлом.
Опция -n Программа sed -n не выводит ничего на стандартный выход. Чтобы получить вывод нужно специальное указание. Мы уже познакомились с модификатором /p, при помощи которого можно дать такое указание. Вспомним файл zar.txt:
$ sed "s/1-9/&/p" zar.txt По утрам он делал зарядку. Молния - электрический заряд.
Так как совпадений с ОБРАЗЦОМ не найдено (в файле нет цифр), то команда s с модификатором /p и знаком & в качестве ЗАМЕНЫ (напомню, что амперсанд означает сам ОБРАЗЕЦ), работает как команда cat.
Если ОБРАЗЕЦ будет найден в файле, то строки, содержащие ОБРАЗЕЦ, будут удвоены:
$ sed "s/зарядку/&/p" zar.txt По утрам он делал зарядку. По утрам он делал зарядку. Молния - электрический заряд.
Теперь добавим опцию -n:
$ sed -n "s/зарядк/&/p" zar.txt По утрам он делал зарядку.
Теперь наша программа работает как команда grep - возвращает только строки, содержащие ОБРАЗЕЦ.
Используя лишь одну команду s, мы убедились в необыкновенно широких возможностях редактора sed. А ведь все, что он делает, сводится к поиску и замене. Причем в процессе работы sed редактирует каждую строку поодиночке, не обращая внимания на другие. Было бы удобно ограничить круг строк, подлежащих изменению, например:
Программа sed умеет все это и даже больше. Любая команда редактора sed может применяться адресно, в некотором диапазоне адресов, или с вышеперечисленными ограничениями круга строк. Адрес или ограничение должны непосредственно предшествовать команде:
Sed "адрес/ограничение команда"
Выбор строк по номерам
Это самый простой случай. Просто указываем номер нужной строки перед командой:
$ sed "4 s/[а-я]*//i" gumilev.txt Какая странная нега В ранних сумерках утра, В таянии вешнего снега, всем, что гибнет и мудро.
$ sed "3 s/В/(В)/" gumilev.txt Какая странная нега В ранних сумерках утра, (В) таянии вешнего снега, Во всем, что гибнет и мудро.
Выбор строк в диапазоне номеров
Диапазон указывается, как не удивительно, через запятую:
$ sed "2,3 s/В/(В)/" gumilev.txt Какая странная нега (В) ранних сумерках утра, (В) таянии вешнего снега, Во всем, что гибнет и мудро.
Если нужно указать диапазон до последней строки файла, а вы не знаете, сколько в нем строк, то воспользуйтесь знаком $:
$ sed "2,$ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.
Выбор строк, содержащих некое выражение
Искомое выражение заключается в прямые слэши (/) и ставится перед командой:
$ sed "/утра/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, В таянии вешнего снега, Во всем, что гибнет и мудро.
Выбор строк в диапазоне между двумя выражениями
Также как и в случае с номерами строк, диапазон задается через запятую:
$ sed "/утра/,/мудро/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.
Выбор строк от начала файла и до некоего выражения
$ sed "1,/снега/ s/в/(в)/i" gumilev.txt Какая странная нега (в) ранних сумерках утра, (в) таянии вешнего снега, Во всем, что гибнет и мудро.
Выбор строк от некоего выражения и до конца файла
$ sed "/снега/,$ s/в/(в)/i" gumilev.txt Какая странная нега В ранних сумерках утра, (в) таянии вешнего снега, (в)о всем, что гибнет и мудро.
Команда d (delete)
Удаляет из стандартного вывода указанные строки:
$ sed "2 d" gumilev.txt Какая странная нега В таянии вешнего снега, Во всем, что гибнет и мудро.
Причем чаще пишут проще (без пробела):
Sed "2d" gumilev.txt
Все, что было сказано в предыдущем разделе о адресации строк, справедливо и для команды d (как и для почти всех команд редактора sed).
При помощи команды d удобно выбросить ненужную "шапку" какого-нибудь почтового сообщения:
$ sed "1,/^$/ d" имя_файла
(Удалить строки с первой и до первой пустой строки).
Избавится от комментариев в конфигурационном файле:
$ sed "/^#/ d" /boot/grub/menu.lst
И мало ли, где нужно удалить лишние строчки!
Команда p (print)
Английское слово "print" переводится как "печатать", что в русском языке ассоциируется с принтером, или, по крайней мере, с клавиатурой. На самом же деле, слово это в английском контексте зачастую означает просто вывод на экран монитора. Так что команда p ничего не печатает, а просто выводит на экран указанные строки.
Будучи примененной сама по себе, команда p удваивает строки в выводе (ведь программа sed по умолчанию выводит строку на экран, а команда p выводит ту же строку вторично).
$ echo у меня есть кот | sed "p" у меня есть кот у меня есть кот
Этому свойству находится применение, например удвоить пустые строки для улучшения вида текста:
$ sed "/^$/ p имя_файла
Но истинное свое лицо команда p раскрывает в сочетании с опцией -n, которая, как вы помните, запрещает вывод строк на экран. Комбинируя опцию -n с командой p, можно получить в выводе только нужные строки.
Например, просмотреть строки с первой по десятую:
$ sed -n "1,10 p" имя_файла
Или только комментарии:
$ sed -n "/^#/ p" /boot/grub/menu.lst # GRUB configuration file "/boot/grub/menu.lst". # generated by "grubconfig". Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Linux bootable partition config begins # Linux bootable partition config ends # Linux bootable partition config begins # Linux bootable partition config ends
Что весьма напоминает работу программы grep, с чем мы уже сталкивались, когда говорили об опции -n с модификатором /p. Но, в отличие от команды grep, редактор sed дает возможность не только найти эти строки, но и изменить их, заменив, например, везде Linux на Unix:
$ sed -n "/^#/ p" /boot/grub/menu.lst | sed "s/Linux/Unix/" # GRUB configuration file "/boot/grub/menu.lst". # generated by "grubconfig". Вск 23 Мар 2008 21:45:41 # # Start GRUB global section # End GRUB global section # Unix bootable partition config begins # Unix bootable partition config ends # Unix bootable partition config begins # Unix bootable partition config ends
Команда!
Иногда нужно бывает редактировать все строки, кроме тех, что соответствуют ОБРАЗЦУ, либо выбору. Символ восклицательного знака (!) инвертирует выбор. Например удалим все строки, кроме второй из четверостишия Гумилева:
$ sed "2 !d" gumilev.txt В ранних сумерках утра,
Или выберем все строки, кроме комментариев, из файла /boot/grub/menu.lst:
$ sed -n "/^#/ !p" /boot/grub/menu.lst default 1 timeout 20 gfxmenu (hd0,3)/boot/message title SuSe on (/dev/hda3) root (hd0,2) kernel /boot/vmlinuz root=/dev/hda3 ro vga=773 acpi=off title Linux on (/dev/hda4) root (hd0,3) kernel /boot/vmlinuz root=/dev/hda4 ro vga=0x317
Команда q (quit)
Команда q прекращает работу программы sed после указанной строки. Это удобно, если нужно прекратить редактирование после достижения определенного места в тексте:
$ sed "11 q" имя_файла
Эта команда закончит работу по достижению 11-й строки.
Команда q - одна из немногих команд sed, не принимающих диапазонов строк. Не может же команда прекратить работу 10 раз подряд, если мы введем:
Sed "1,10 q" Абсурд!
Команда w (write)
Подобно модификатору w команды s, эта команда позволяет записать вывод программы в файл:
$ sed -n "3,$ w gum.txt" gumilev.txt
Мы получим файл gum.txt, содержащий две последние строки четверостишия Гумилева из файла gumilev.txt. Причем, если такой файл уже существует, то будет перезаписан. Если не ввести опцию -n, то программа, кроме создания файла gum.txt, еще и выведет на экран все содержание файла gumilev.txt.
Для работы в командной строке, удобнее пользоваться обычным перенаправлением вывода (> или >>), но в sed скриптах, вероятно, команда w найдет свое применение.
Команда r (read)
Эта команда не только прочтет указанный файл, но и вставит его содержимое в нужное место редактируемого файла. Для выбора "нужного места" используется уже знакомая нам адресация (по номерам строк, по выражениям, и проч.). Пример:
$ echo Из стихотворения Гумилева: | sed "r gumilev.txt"
Из стихотворения Гумилева:
Какая странная нега В ранних сумерках утра, В таянии вешнего снега, Во всем, что гибнет и мудро.
Команда =
Выдаст номер указанной строки:
$ sed "/снега/=" gumilev.txt Какая странная нега В ранних сумерках утра, 3 В таянии вешнего снега, Во всем, что гибнет и мудро.
$ sed -n "/снега/=" gumilev.txt 3
Команда принимает только один адрес, не принимает интервалов.
Команда y
Эта команда заменяет символы из секции ОБРАЗЕЦ символами секции ЗАМЕНА, работая как программа tr .
$ echo Автомобиль - наследие прошлого | sed "y/Авто/Паро/" Паромобиль - наследие прошлого
Команда y работает, только если количество символов в ОБРАЗЦЕ равно количеству символов в ЗАМЕНЕ.
Для того, чтобы пользоваться редактором sed как полноценным текстовым редактором, необходимо освоить составление скриптов sed. Программа sed имеет собственный несложный язык программирования, позволяющий составлять скрипты, способные творить чудеса.
Эта статья не может вместить описания скриптов sed, как и ее автор не ставит себе задачу освоение языка программирования sed. В этой статье я делал акцент на использование редактора sed в командной строке, имея прицел на использование его в качестве фильтра в программных каналах (pipes). По этой причине я опустил многочисленные команды sed, применяющиеся только в его скриптах.
Существует множество любителей редактора sed, и множество статей на тему скриптописания, в том числе и в Рунете. Так что для заинтересовавшихся этой замечательной программой не составит труда пополнить свои знания.
Как видно из примеров в этой статье, программа sed на правильно русифицированной системе свободно владеет "великим и могучим" языком.
Программа sed - это многофункциональный редактор потока данных, незаменимый для:
Для освоения программы sed в полном объеме потребуются недели или даже месяцы работы, так как для этого необходимо:
С другой стороны, освоить несколько наиболее употребительных команд редактора sed не сложнее, чем любую команду Юникс; надеюсь, данная статья поможет вам в этом.
До сих пор, в статьях цикла HuMan, я стремился хотя бы вкратце раскрыть каждую опцию, каждый параметр описываемой команды, так чтобы статья могла заменить маны. В дальнейшем я буду продолжать придерживаться этого принципа.
Данная статья является исключением, так как не описывает всех возможностей программы. Для полного их описания потребовалась бы не статья, а книга. Тем не менее, статья позволяет получить представление о редакторе sed и начать работать с этой удивительной программой, используя наиболее употребительные ее команды.
Документ создан: 16.02.2010
For i in *.txt; do sed -i "/^\^/ s/^\^\([^\^]*\)\^\^/====\1====/;/^=/ s/$/ \n^ Команда ^ Описание ^/" $i; done
Эта строка проходит в цикле по всем файлам в текущем каталоге, имена которых оканчиваются на.txt, и:
/^\^/ s/^\^\([^\^]*\)\^\^/====\1====/ – если строка начинается с " ^ ", заменить " ^ Текст ^^ ". на " ==== Текст ==== ";
/^=/ s/$/ \n^ Команда ^ Описание ^/ - если строка начинается на " = " (а она начинается, т.к. в предыдущем пункте мы сами это сделали, и здесь условие только для того, чтобы не трогать остальные строки), заменить эту строку на неё же, плюс возврат каретки, плюс " ^ Команда ^ Описание ^ ". Другими словами, вставить после такой строки строку содержащую " ^ Команда ^ Описание ^ ".
Для чего это? Вот для чего. Я разбил длинный dokuwiki-файл с командами линукс на мелкие файлы. Они получились вида:
^ Анализ файловых систем ^^ | badblocks -v /dev/hda1 | проверить раздел hda1 на наличие bad-блоков | ...
Данная последовательность команд превратила их все в вид:
Анализ файловых систем ==== ^ Команда ^ Описание ^ | badblocks -v /dev/hda1 | проверить раздел hda1 на наличие bad-блоков | ...
Для удаления строки, содержащей определённый контекст, можно использовать следующую конструкцию:
Sed -i "/^AUTO_SAVE/ d" notes.ini
Эта команда в файле notes.ini удаляет все строки, начинающиеся с AUTO_SAVE .
Для удаления строки или нескольких строк в файле я использую следующую конструкцию:
Sed -i "2,1d"
Эта команда в файле
Sed -i "5,10d"
Эта команда в файле
Объединить попарно две строки, разделённые возвратом каретки:
Cat /etc/hosts | sed "N;s/\n/ - /"
PS. Разделитель: " - ".
В верхний регистр:
Echo Sed | sed "s/.*/\U&/" SED
В нижний регистр:
Echo Sed | sed "s/.*/\L&/" sed
Для примера возьмём результат работы dig:
$ dig ya.ru
выдаст нам
; <<>> DiG 9.7.0-P1 <<>> ya.ru ;; global options: +cmd ;; Got answer: ;; ->>HEADER<<- opcode: QUERY, status: NOERROR, id: 5252 ;; flags: qr rd ra; QUERY: 1, ANSWER: 5, AUTHORITY: 0, ADDITIONAL: 0 ;; QUESTION SECTION: ;ya.ru. IN A ;; ANSWER SECTION: ya.ru. 4194 IN A 87.250.251.3 ya.ru. 4194 IN A 93.158.134.3 ya.ru. 4194 IN A 213.180.204.3 ya.ru. 4194 IN A 77.88.21.3 ya.ru. 4194 IN A 87.250.250.3 ;; Query time: 0 msec ;; SERVER: 192.168.2.9#53(192.168.2.9) ;; WHEN: Wed Nov 10 14:33:37 2010 ;; MSG SIZE rcvd: 103
а выполнив:
Dig ya.ru | sed "0,/ANSWER SECTION:/d; /^$/q"
Ya.ru. 4160 IN A 93.158.134.3 ya.ru. 4160 IN A 213.180.204.3 ya.ru. 4160 IN A 77.88.21.3 ya.ru. 4160 IN A 87.250.250.3 ya.ru. 4160 IN A 87.250.251.3
0,/ANSWER SECTION:/d - удаляет все строки потока с первой и до строки, в которой встречается " ANSWER SECTION: ", включительно
/^$/q - как только встречается пустая строка, прекратить дальнейшую обработку.
Подготовка:
Cat /etc/passwd > ./test
SED | Описание |
---|---|
cat ./test | sed -e "s/systemd/SysV/g; s/Management/Unmanaged/" | К каждой строке применить две замены |
cat ./test | sed -n "s/systemd/SysV/p" | Вывести только заменяемые строки. -n - подавляет обычный вывод. |
cat ./test | sed "s/systemd/SysV/w ./out" | Вывести замену в файл out |
cat ./test | sed "41s/systemd/SysV/" | Произвести замену в 41 строке |
cat ./test | sed "41,44s/systemd/SysV/" | Произвести замену в строках с 41 по 44 включительно. |
cat ./test | sed "41,$s/systemd/SysV/" | Произвести замену в строках с 41 до последней включительно. |
cat ./test | sed "/games/,/syslog/ s!/usr/sbin/nologin!/bin/bash!" | Произвести замену в строках, которые находятся между строками, содержащими games и syslog включительно |
cat ./test | sed "1c\DELETED" | Заменить первую строку полность |
cat ./test | sed "1,5c\DELETED" | Заменить текстом строки с 1 по 5 включительно |
cat ./test | sed "y!:/!;\\!" | Заменить ":" на ";", а "/" на "\" |
cat ./test | sed "=" | Вывести и номера строк тоже |
cat ./test | sed -n "/systemd/=" | Вывести номера строк, в которых встречается подстрока |
Вставить в поток содержимое файла (out): | |
cat ./test | sed "1rout" | после 1 строки |
cat ./test | sed "$r out" | после последней строки |
cat ./test | sed "1,4rout" | после 1, 2, 3 и 4 строк |
cat ./test | sed "/syslog/r out" | после строки, содержащей syslog |
Произвести удаление строк: | |
cat ./test | sed "/games/,/syslog/d" | которые находятся между строками, содержащими games и syslog включительно |
cat ./test | sed "3,5d" | с 3 по 5 |
cat ./test | sed "5,$d" | с 5 до конца |