如何使用Red Hat Linux上的标准工具随机化文件中的行?

时间:2009-05-20 05:12:01

标签: linux file random redhat shuffle

如何使用Red Hat Linux上的标准工具随机化文件中的行?

我没有shuf命令,因此我正在寻找像perlawk一行一样完成相同任务的事情。

11 个答案:

答案 0 :(得分:195)

嗯,别忘了

sort --random-sort

答案 1 :(得分:105)

shuf是最好的方式。

sort -R非常缓慢。我只是尝试排序5GB文件。我放弃了2.5小时后。然后shuf在一分钟内对其进行排序。

答案 2 :(得分:62)

你得到一个Perl单行!

perl -MList::Util -e 'print List::Util::shuffle <>'

它使用模块,但该模块是Perl代码分发的一部分。如果这还不够好,你可以考虑自己动手。

我尝试使用-i标记(“编辑就地”)来编辑文件。文档表明它应该有效,但事实并非如此。它仍然将混洗文件显示到stdout,但这次它会删除原始文件。我建议你不要用它。

考虑一个shell脚本:

#!/bin/sh

if [[ $# -eq 0 ]]
then
  echo "Usage: $0 [file ...]"
  exit 1
fi

for i in "$@"
do
  perl -MList::Util -e 'print List::Util::shuffle <>' $i > $i.new
  if [[ `wc -c $i` -eq `wc -c $i.new` ]]
  then
    mv $i.new $i
  else
    echo "Error for file $i!"
  fi
done

未经测试,但希望有效。

答案 3 :(得分:21)

cat yourfile.txt | while IFS= read -r f; do printf "%05d %s\n" "$RANDOM" "$f"; done | sort -n | cut -c7-

读取文件,在每行前面加一个随机数,在随机前缀上对文件进行排序,然后剪切前缀。单衬里应该适用于任何半现代的外壳。

编辑:纳入理查德汉森的言论。

答案 4 :(得分:9)

python的单行:

python -c "import random, sys; lines = open(sys.argv[1]).readlines(); random.shuffle(lines); print ''.join(lines)," myFile

只打印一条随机线:

python -c "import random, sys; print random.choice(open(sys.argv[1]).readlines())," myFile

但请参阅this post了解python的random.shuffle()的缺点。它不适用于许多(超过2080个)元素。

答案 5 :(得分:5)

与Jim的回答相关:

我的~/.bashrc包含以下内容:

unsort ()
{
    LC_ALL=C sort -R "$@"
}

使用GNU coreutils的排序-R = --random-sort,它生成每行的随机哈希并按其排序。随机散列实际上不会在某些较旧(错误)版本的某些语言环境中使用,导致它返回正常的排序输出,这就是我设置LC_ALL=C的原因。


与克里斯的回答相关:

perl -MList::Util=shuffle -e'print shuffle<>'

是一个略短的单线。 (-Mmodule=a,b,c-e 'use module qw(a b c);'的简写。)

给它一个简单的-i的原因不适用于就地改组是因为Perl期望print发生在同一个循环中,正在读取文件,{{1}在读取并关闭所有输入文件之后才会输出。

作为一种较短的解决方法,

print shuffle <>

将就地文件进行随机播放。 (perl -MList::Util=shuffle -i -ne'BEGIN{undef$/}print shuffle split/^/m' 表示“将代码包装在-n循环中; while (<>) {...}使Perl一次对文件进行操作,而不是一次一行地进行操作,并{{1因为BEGIN{undef$/}已经用整个文件而不是行隐式地完成了,所以需要这样做。)

答案 6 :(得分:3)

当我使用自制软件安装coreutils时

brew install coreutils

shuf可用n

答案 7 :(得分:1)

使用DarwinPorts的Mac OS X:

sudo port install unsort
cat $file | unsort | ...

答案 8 :(得分:1)

FreeBSD有自己的随机实用程序:

cat $file | random | ...

它位于/ usr / games / random中,所以如果你还没有安装游戏,那你就不走运了。

您可以考虑安装textproc / rand或textproc / msort等端口。如果可移植性是一个问题,这些可能在Linux和/或Mac OS X上可用。

答案 9 :(得分:-1)

在OSX上,从http://ftp.gnu.org/gnu/coreutils/抓取最新内容,例如

./配置 使 sudo make install

...应该给你/ usr / local / bin / sort --random-sort

没有弄乱/ usr / bin / sort

答案 10 :(得分:-1)

或者从MacPorts获取:

$ sudo port install coreutils

和/或

$ /opt/local//libexec/gnubin/sort --random-sort