用Matlab解析文本

时间:2010-10-04 08:46:45

标签: regex matlab

我有一个我想要清理的文本文件(来自旧程序的输出)。这是文件内容的一个示例。

*|V|0|0|0|t|0|1|1|4|11|T4|H01|||||||||||||||||||||| 


P|40|0.01|10|1|1|0|40|1|1|1||1|*||0|0|0|||||||||||||||| 
*|A1|A1|A7|A16|F|F|F|F|F|F|F||||||||||||||||||||||| 
*|||||kV|kV|kV|MW|MVAR|S|S|||||||||||||||||||||||| 
N|I|01|H01N01|H01N01|132|125.4|138.6|0|0||||||||||||||||||||| 
N|I|01|H01N02|H01N02|20|19|21|0|0||||||||||||||||||||||| 
N|I|01|H01N03|H01N03|20|19|21|0.42318823|0.204959433||||||||||||||||||||| 
||||||||||||||||| 
||||||||||||||||| 
L|I|H010203|H01N02|H01N03|1.884|360|0.41071|0.207886957||3.19E-08|3.19E-08||||||||||| 
L|I|H010304|H01N03|H01N04|1.62|360|0.35316|0.1787563||3.19E-08||3.19E-08|||||||||||| 
L|I|H010405|H01N04|H01N05|0.532|360|0.11598|0.058702686||3.19E-08||3.19E-08||||||||||| 
L|I|H010506|H01N05|H01N06|1.284|360|0.27991|0.14168092||3.19E-08||3.19E-08|||||||||||| 
S|SH01|SEZIONE01|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH02|SEZIONE02|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH03|SEZIONE03|1|-3|+3|-100|+100||||||||||||||||||| 
||||||||||||asasasas 
S|SH04|SEZIONE04|1|-3|+3|-100|+100||||||||||||||||||| 
*|comment 
S|SH05|SEZIONE05|1|-3|+3|-100|+100|||||||||||||||||||

我希望它看起来像:

*|V|0|0|0|t|0|1|1|4|11|T4|H01|||||||||||||||||||||| 
*|comment 
*|comment 
P|40|0.01|10|1|1|0|40|1|1|1||1|*||0|0|0|||||||||||||||| 
*|A1|A1|A7|A16|F|F|F|F|F|F|F||||||||||||||||||||||| 
*|||||kV|kV|kV|MW|MVAR|S|S|||||||||||||||||||||||| 
N|I|01|H01N01|H01N01|132|125.4|138.6|0|0||||||||||||||||||||| 
N|I|01|H01N02|H01N02|20|19|21|0|0||||||||||||||||||||||| 
N|I|01|H01N03|H01N03|20|19|21|0.42318823|0.204959433||||||||||||||||||||| 
*|comment|||||||||||||||| 
*|comment||||||||||||||||| 
L|I|H010203|H01N02|H01N03|1.884|360|0.41071|0.207886957||3.19E-08||3.19E-08||||||||||| 
L|I|H010304|H01N03|H01N04|1.62|360|0.35316|0.1787563||3.19E-08||3.19E-08|||||||||||||| 
L|I|H010405|H01N04|H01N05|0.532|360|0.11598|0.058702686||3.19E-08||3.19E-08||||||||||| 
L|I|H010506|H01N05|H01N06|1.284|360|0.27991|0.14168092||3.19E-08||3.19E-08|||||||||||| 
*|comment 
*|comment 
S|SH01|SEZIONE01|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH02|SEZIONE02|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH03|SEZIONE03|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH04|SEZIONE04|1|-3|+3|-100|+100||||||||||||||||||| 
S|SH05|SEZIONE05|1|-3|+3|-100|+100||||||||||||||||||| 

数据分为与第一个字母(PNLS)不同的“包”。每个包必须至少有两个专用行(* |),然后将其作为注释读取。不同字母之间的白线用字符* |填充。各种字母之间的行不以* |开头待补充。白色线条和相同字母之间的“随机”字符将被删除。

也许在示例文件中更清楚。

我如何操纵文字?提前感谢您的帮助。

1 个答案:

答案 0 :(得分:0)

使用fileread将您的文件存入MATLAB。

text = fileread('my file to clean.txt');

通过拆分新行来拆分生成的字符串。 (换行符取决于您的操作系统。)

lines = regexp(text, '\r\n', 'split');

目前还不完全清楚你希望如何清理文件,但这些事情可能会让你开始。

% Replace blank lines with comment string
blanks = cellfun(@isempty, lines);
comment = '*|comment';
lines(blanks) = cellstr(repmat(comment, sum(blanks), 1))

% Prepend comment string to lines that start with a pipe
lines = regexprep(lines, '^\|', '\*\|comment\|')

你需要了解正则表达式的方法。在regular-expressions.info有一个很好的指南。