Ruby's Louvre

The Crankiness of Belief achieves Great , not the Trick of Regulation.

JavaScript trim函数大赏

W3C那帮人的脑袋被驴踢了,直到javascript1.8.1才支持trim函数(与trimLeft,trimRight),可惜现在只有firefox3.5支持。由于去除字符串两边的空白实在太常用,各大类库都有它的影子。加之,外国人都很有研究精神,搞鼓了相当多实现。

实现1

  String.prototype.trim = function() {
    return this.replace(/^\s\s*/, '').replace(/\s\s*$/, '');
  }

看起来不怎么样,动用了两次正则替换,实际速度非常惊人,主要得益于浏览器的内部优化。一个著名的例子字符串拼接,直接相加比用Array做成的StringBuffer还快。base2类库使用这种实现。

实现2

  String.prototype.trim = function() {
    return this.replace(/^\s+/, '').replace(/\s+$/, '');
  }

和实现1很相似,但稍慢一点,主要原因是它最先是假设至少存在一个空白符。Prototype.js使用这种实现,不过其名字为strip,因为Prototype的方法都是力求与Ruby同名。

实现3

  String.prototype.trim = function() {
    return  this.substring(Math.max(this.search(/\S/), 0),this.search(/\S\s*$/) + 1);
  }

以截取方式取得空白部分(当然允许中间存在空白符),总共调用了四个原生方法。设计得非常巧妙,substring以两个数字作为参数。Math.max以两个数字作参数,search则返回一个数字。速度比上面两个慢一点,但比下面大多数都快。

实现4

  String.prototype.trim = function() {
    return  this.replace(/^\s+|\s+$/g, '');
  }

这个可以称得上实现2的简化版,就是利用候选操作符连接两个正则。但这样做就失去了浏览器优化的机会,比不上实现3。由于看来很优雅,许多类库都使用它,如JQuery与mootools

实现5

  String.prototype.trim = function() {
    var str = this;
    str = str.match(/\S+(?:\s+\S+)*/);
    return str ? str[0] : '';
  }

match是返回一个数组,因此原字符串符合要求的部分就成为它的元素。为了防止字符串中间的空白符被排除,我们需要动用到非捕获性分组(?:exp)。由于数组可能为空,我们在后面还要做进一步的判定。好像浏览器在处理分组上比较无力,一个字慢。所以不要迷信正则,虽然它基本上是万能的。

实现6

  String.prototype.trim = function() {
    return this.replace(/^\s*(\S*(\s+\S+)*)\s*$/, '$1');
  }

把符合要求的部分提供出来,放到一个空字符串中。不过效率很差,尤其是在IE6中。

实现7

  String.prototype.trim = function() {
    return this.replace(/^\s*(\S*(?:\s+\S+)*)\s*$/, '$1');
  }

和实现6很相似,但用了非捕获分组进行了优点,性能效之有一点点提升。

实现8

  String.prototype.trim = function() {
    return this.replace(/^\s*((?:[\S\s]*\S)?)\s*$/, '$1');
  }

沿着上面两个的思路进行改进,动用了非捕获分组与字符集合,用?顶替了*,效果非常惊人。尤其在IE6中,可以用疯狂来形容这次性能的提升,直接秒杀火狐。

实现9

  String.prototype.trim = function() {
    return this.replace(/^\s*([\S\s]*?)\s*$/, '$1');
  }

这次是用懒惰匹配顶替非捕获分组,在火狐中得到改善,IE没有上次那么疯狂。

实现10

  String.prototype.trim = function() {
    var str = this,
    whitespace = ' \n\r\t\f\x0b\xa0\u2000\u2001\u2002\u2003\u2004\u2005\u2006\u2007\u2008\u2009\u200a\u200b\u2028\u2029\u3000';
    for (var i = 0,len = str.length; i < len; i++) {
      if (whitespace.indexOf(str.charAt(i)) === -1) {
        str = str.substring(i);
        break;
      }
    }
    for (i = str.length - 1; i >= 0; i--) {
      if (whitespace.indexOf(str.charAt(i)) === -1) {
        str = str.substring(0, i + 1);
        break;
      }
    }
    return whitespace.indexOf(str.charAt(0)) === -1 ? str : '';
  }

我只想说,搞出这个的人已经不是用牛来形容,已是神一样的级别。它先是把可能的空白符全部列出来,在第一次遍历中砍掉前面的空白,第二次砍掉后面的空白。全过程只用了indexOf与substring这个专门为处理字符串而生的原生方法,没有使用到正则。速度快得惊人,估计直逼上内部的二进制实现,并且在IE与火狐(其他浏览器当然也毫无疑问)都有良好的表现。速度都是零毫秒级别的。

实现11

  String.prototype.trim = function() {
    var str = this,
    str = str.replace(/^\s+/, '');
    for (var i = str.length - 1; i >= 0; i--) {
      if (/\S/.test(str.charAt(i))) {
        str = str.substring(0, i + 1);
        break;
      }
    }
    return str;
  }

实现10已经告诉我们普通的原生字符串截取方法是远胜于正则替换,虽然是复杂一点。但只要正则不过于复杂,我们就可以利用浏览器对正则的优化,改善程序执行效率,如实现8在IE的表现。我想通常不会有人在项目中应用实现10,因为那个whitespace 实现太长太难记了(当然如果你在打造一个类库,它绝对是首先)。实现11可谓其改进版,前面部分的空白由正则替换负责砍掉,后面用原生方法处理,效果不逊于原版,但速度都是非常逆天。

实现12

  String.prototype.trim = function() {
    var str = this,
    str = str.replace(/^\s\s*/, ''),
    ws = /\s/,
    i = str.length;
    while (ws.test(str.charAt(--i)));
    return str.slice(0, i + 1);
  }

实现10与实现11在写法上更好的改进版,注意说的不是性能速度,而是易记与使用上。和它的两个前辈都是零毫秒级别的,以后就用这个来工作与吓人。

下面是老外给出的比较结果,执行背景是对Magna Carta 这文章(超过27,600字符)进行trim操作。

实现 Firefox 2 IE 6
trim1 15ms < 0.5ms
trim2 31ms < 0.5ms
trim3 46ms 31ms
trim4 47ms 46ms
trim5 156ms 1656ms
trim6 172ms 2406ms
trim7 172ms 1640ms
trim8 281ms < 0.5ms
trim9 125ms 78ms
trim10 < 0.5ms < 0.5ms
trim11 < 0.5ms < 0.5ms
trim12 < 0.5ms < 0.5ms

原文链接:http://blog.stevenlevithan.com/archives/faster-trim-javascript

注意本文非翻译,只是根据其中提到的trim函数实现发表自己的想法,想知道原作者说什么请看原文。

https://developer.mozilla.org/cn/Core_JavaScript_1.5_Reference/Global_Objects/RegExp

标签: javascript

posted on 2009-09-18 00:15 司徒正美 阅读(6516) 评论(38) 编辑 收藏

评论

#1楼 2009-09-18 06:45 Astar      

收集,楼主好像天天都发。  回复 引用 查看   

#2楼 2009-09-18 08:07 董广祥      

不错  回复 引用 查看   

#3楼 2009-09-18 08:52 awp110      

很好  回复 引用 查看   

#4楼 2009-09-18 08:53 Ztmdsbt      

W3C那帮人的脑袋被驴踢了
...
这句很欣赏.哈哈
 回复 引用 查看   

#5楼 2009-09-18 08:53 Ryan Gene      

厉害,十那个神了。。。  回复 引用 查看   

#6楼 2009-09-18 08:55 KenBlove      

进来网一个来用~  回复 引用 查看   

#7楼 2009-09-18 09:01 heeroluo.net[未注册用户]

不知道阁下有没有亲自测试过,我在IE6、IE8下测试结果都是实现四最快。  回复 引用   

#8楼 2009-09-18 09:03 YJJ      

W3C那帮人的脑袋被驴踢了
对哇,占着茅坑不拉si,仗着标准不办事
 回复 引用 查看   

#9楼 2009-09-18 09:09 heeroluo[未注册用户]

骂W3C干什么,即使W3C宣布支持了,国内一大堆IE6,到头来还不是一场空  回复 引用   

#10楼 2009-09-18 10:01 GWPBrian      

 回复 引用 查看   

#11楼 2009-09-18 10:10 winter-cn      

W3C那帮人的脑袋被驴踢了,
--------------------------------
这话不假

直到javascript1.8.1才支持trim函数(与trimLeft,trimRight),可惜现在只有firefox3.5支持。
------------------------------------------------
但这个事情跟W3C没关系 其实JavaScript的标准化不是W3C做的 而是ECMA
而javascript1.8.1是Mozilla的一个未被标准化的私有版本,所以不可能有人去支持
 回复 引用 查看   

#12楼 2009-09-18 10:20 Collector      

多的不说了,两个字--收藏。
楼主是这里的js宝库哈。
 回复 引用 查看   

#13楼 2009-09-18 10:46 小赛布里      

指点一下啊
\n\r\t\f\x0b\xa0\u2000\u2001\u2002\u2003\u2004\u2005\u2006\u2007\u2008\u2009\u200a\u200b\u2028\u2029\u3000
这个。。。没看懂
换行 回车 TAB 后面的什么意思?
 回复 引用 查看   

#14楼 2009-09-18 10:56 鱼蛋      

牛x啊  回复 引用 查看   

#15楼 2009-09-18 10:57 vieri122      

楼主加油,我无限挺你!  回复 引用 查看   

#16楼 2009-09-18 11:13 陶发辉      

牛人。终于见识到牛人了!  回复 引用 查看   

#17楼 2009-09-18 11:28 Selfocus      

第一眼看到实现10的时候,认为这是最慢的实现(还用到了循环),而结果恰恰相反  回复 引用 查看   

#18楼 2009-09-18 11:33 Ylin Rain      

拜见牛人,真的很有功底。  回复 引用 查看   

#19楼 2009-09-18 11:42 竹子小毅      

实在牛人,可是不知道那个时间是怎么测试出来的
 回复 引用 查看   

#20楼 2009-09-18 13:06 要有好的心情      

好文,功力深厚呀  回复 引用 查看   

#21楼 2009-09-18 13:36 winter-cn      

引用小赛布里:
指点一下啊
\n\r\t\f\x0b\xa0\u2000\u2001\u2002\u2003\u2004\u2005\u2006\u2007\u2008\u2009\u200a\u200b\u2028\u2029\u3000
这个。。。没看懂
换行 回车 TAB 后面的什么意思?

这些是unicode的whitespace分类里面的所有字符  回复 引用 查看   

#22楼 2009-09-18 13:38 winter-cn      

http://www.cs.tut.fi/~jkorpela/chars/spaces.html  回复 引用 查看   

#23楼 2009-09-18 13:46 纯属调侃 楼主莫怪[未注册用户]

茴香豆的茴字有四种写法。。。  回复 引用   

#24楼[楼主] 2009-09-18 14:29 司徒正美      

@小赛布里

' ' 相当于\u0020 空格<SP>
'\n' 相当于\u000a 换行<LF>
'\r' 相当于\u000d 回车<CR>
'\t' 相当于\u0009 水平制表符<TAB>
'\f' 相当于\u000c 换页
'\x0b' 垂直制表符<VT>
'\xa0' 相当于\u0160,亦即'&#160;' 就即'&nbsp;' 不断行的空白(1个字符宽度)<NBSP> No-break Space
'\u2000' (不知道)
'\u2001' (不知道)
'\2002'..'\u200a' 定宽空格Fixed width spaces
其中
\u2002即'&ensp;'半个空白(1个字符宽度)
\u2003即'&emsp;'一个空白(2个字符宽度)

'\u200b' 零宽空格Zero-width Space
'\u2028' 行分隔符 <LS> (我们使用word打文章时每行后出现的小符号)
'\u2029' 段落分隔符<PS>(类推)
'\u3000' (不知道)
 回复 引用 查看   

#25楼[楼主] 2009-09-18 14:38 司徒正美      

哦,上面有高人给出答案了!不愧是51js的版主!  回复 引用 查看   

#26楼 2009-09-18 14:40 Gnie      

楼主的问我全收了  回复 引用 查看   

#27楼 2009-09-18 15:20 love .net FrameWork      

楼主牛人,佩服啊。  回复 引用 查看   

#28楼 2009-09-18 15:52 vieri122      

ws.test这个函数没看懂!  回复 引用 查看   

#29楼[楼主] 2009-09-18 15:54 司徒正美      

@vieri122
ws.test是用来退出循环。
 回复 引用 查看   

#30楼 2009-09-18 16:03 vieri122      

@司徒正美
string类自带test方法??
 回复 引用 查看   

#31楼 2009-09-18 16:04 vieri122      

@司徒正美
晕看错了,原来ws是正则表达式对象
 回复 引用 查看   

#32楼 2009-09-18 16:11 High      

受教了!!!  回复 引用 查看   

#33楼 2009-09-18 18:02 xiaosuo      

天天看到楼主的js随笔!太强了  回复 引用 查看   

#34楼 2009-09-21 00:02 Kenneth Chen      

楼主功底相当强,学习了!  回复 引用 查看   

#35楼 2009-11-10 15:56 老老驴[未注册用户]

LZ想法不错,文笔也不错,赞一个~  回复 引用   

#36楼 2009-12-22 23:38 AK47      

总结得不错  回复 引用 查看   

#37楼 2011-03-14 12:34 Laoshu133      

其实以前看过这篇文章了,今天偶尔又碰到了,有一想法:
function trim(str){
var m=0, n=0, i=0, re=/\s/;
for(; i<str.length; i++){
if(!re.test(str.charAt(i))){
m = i;
}
}
for(i = str.length - 1; i>=m; i--){
if(!re.test(str.charAt(i))){
n = i;
}
}
return str.slice(m,n + 1);
}
console.log('1111---' + trim(' 133 ') + '----00000');
 回复 引用 查看   

#38楼 2011-03-14 12:38 Laoshu133      

function trim(str){
var m=0, n=0, i=0, re=/\s/;
for(; i<str.length; i++){
if(!re.test(str.charAt(i))){
m = i;
break;
}
}
for(i = str.length - 1; i>=m; i--){
if(!re.test(str.charAt(i))){
n = i;
break;
}
}
return str.slice(m,n + 1);
}
晕,不小心少了个break;
 回复 引用 查看