当前位置：移动技术网 > IT编程>开发语言>.net > asp.NET 脏字过滤算法修改版

asp.NET 脏字过滤算法修改版

2017年12月12日 | 移动技术网IT编程 | 我要评论

666rtys,八路军女兵蒙难记,库迪奇尼

旧的算法是简单对每一个脏字调用一遍 string.replace，当然是用了stringbuilder。//www.jb51.net/article/20575.htm。在我这里测试的时候，regex要快一倍左右。但是还是不太满意，应为我们网站上脏字过滤用的相当多，经过一番思考后，自己做了一个算法。在自己的机器上测试了一下，使用原文中的脏字库，0x19c的字符串长度，1000次循环，文本查找耗时1933.47ms，regex用了1216.719ms，而我的算法只用了34.125ms.

算法的关键，还是使用空间来换时间，使用了2个全局的bitarray, 长度均为char.maxvalue。其中一个bitarray用来判断是否有某个char开头的脏字，另一个bitarray用来判断所有脏字中是否包含某个char。经过这两个bitarray，可以做出快速判断，之后就使用hash code来判断完整的脏字，通过预先获取的最大脏字长度优化遍历过程。

需要的变量如下：

复制代码代码如下:

 
private dictionary<string, object> hash = new dictionary<string, object>(); 
private bitarray firstcharcheck = new bitarray(char.maxvalue); 
private bitarray allcharcheck = new bitarray(char.maxvalue); 
private int maxlength = 0; 

其中hash只使用到了key，value都置为null。也可以使用.net 3.5中的hashset，或者使用dictionary<string, int>，记录脏字的出现次数。

初始化这些数据的方法如下：

复制代码代码如下:

 
foreach (string word in badwords) 
{ 
if (!hash.containskey(word)) 
{ 
hash.add(word, null); 
maxlength = math.max(maxlength, word.length); 
firstcharcheck[word[0]] = true; 

foreach (char c in word) 
{ 
allcharcheck[c] = true; 
} 
} 
} 

判断脏字是否出现在一个字符串中的代码如下：

复制代码代码如下:

 
int index = 0; 
int offset = 0; 
while (index < text.length) 
{ 
if (!firstcharcheck[text[index]]) 
{ 
while (index < text.length - 1 && !firstcharcheck[text[++index]]) ; 
} 

for (int j = 1; j <= math.min(maxlength, text.length - index); j++) 
{ 
if (!allcharcheck[text[index + j - 1]]) 
{ 
break; 
} 

string sub = text.substring(index, j); 

if (hash.containskey(sub)) 
{ 
return true; 
} 
} 

index++; 
} 

return false; 

替换的代码就不贴了，跟判断包含类似，只不过不能发现一个脏字后就退出循环。如果出现脏字的可能不是很高，就没有必要创建一个临时的stringbuilder。

进一步，可以通过借鉴.net源码中string.gethashcode()的实现，避免一次substring的调用，提高性能。也可以设计递进的hashcode实现，比如"helloworld"可以用"helloworl"的hash进一步计算，优化效率。

另外，也可以抛弃hash，改用排序过的string[]，用binarysearch来判断sub是否为脏字。binarysearch的结果是可以递进的，即可以用查找"helloworl"的结果来加速判断"helloworld"。（已测试，700个脏字，binarysearch的效率有时会低很多。）
最后发一点牢骚，当初最早发的时候（//www.jb51.net/article/20576.htm），仅仅是为了说明下自己的算法，具体的代码甚至还有一点错误。两个事情让我觉得心里不很爽，一个是被乱七八糟的无数网站转载而不说明出处，导致我后来的改进和错误修正达不到效果，二是一些人都愿意看到最终的代码，而不是理解我想要表达的最核心的设计，然后自己去考虑实现。

您可能感兴趣的文章:

如对本文有疑问，请在下面进行留言讨论，广大热心网友会与你互动！！点击进行留言回复

详解.NET Core 3.0 里新的JSON API

为什么需要新的 json api ？json.net 大家都用过，老版本的 asp.net core 也依赖于 json.net 。然而这个依赖就会引起一些版... [阅读全文]
Net Core Web Api项目与在NginX下发布的方法

前言本文将介绍net core的一些基础知识和如何nginx下发布net core的webapi项目。测试环境操作系统：windows 10 开发工具：v... [阅读全文]
浅谈ASP.NET Core 中jwt授权认证的流程原理

1，快速实现授权验证什么是 jwt ？为什么要用 jwt ？jwt 的组成？这些百度可以直接找到，这里不再赘述。实际上，只需要知道 jwt 认证模式是使用一段 ... [阅读全文]
.Net Core 实现图片验证码的实现示例

记录自己的学习，参考了网上各位大佬的技术，往往在登录的时候需要使用到验证码来进行简单的一个校验，这边使用在.net core上进行生成图片二维码思路很简单=》 ... [阅读全文]
asp.net core3.1 引用的元包dll版本兼容性问题解决方案

自从.netcore 3.1出来后，大家都想立马升级到最新版本。我也是如此，微软也对.netcore 3.1 的官方组件不断升级，几乎每隔几天就会有部分元包可以... [阅读全文]
IdentityServer4实现.Net Core API接口权限认证(快速入门)

什么是identityserver4官方解释：identityserver4是基于asp.net core实现的认证和授权框架，是对openid connect... [阅读全文]
从ASP.NET Core3.1迁移到5.0的方法

3月中旬，微软官方已经发布了dotnet 5的第一个预览版：5.0.0-preview.1。dotnet core经过前几个版本的发展和沉淀，到3.1已经基本趋... [阅读全文]
.NET Core中创建和使用NuGet包的示例代码

在.net core的项目中，如果我们要在项目中引用其它dll文件，不建议直接在项目引用中添加dll文件（虽然在.net core项目中也可以这么做），建议是去... [阅读全文]
ASP.NET Core MVC通过IViewLocationExpander扩展视图搜索路径的实现

iviewlocationexpander api expandviewlocations razor视图路径，视图引擎会搜索该路径. populateva... [阅读全文]
ASP.NET Core中的Controller使用示例

asp.net core出现之前我们实现的controller，mvc都继承自controller基类，webapi的话继承自apicontroller。现在a... [阅读全文]