2007年7月27日

浪费时间的40种方式

1、电话
2、打扰者、突然来访者
3、会议(预约、没预约)
4、争吵、发火
5、缺乏目标、时间计划、优先计划
6、杂乱的办公室和工作桌、个人的无序性
7、无效率的代表、委托人
8、作无用的尝试
9、同一时间,想法、尝试过多
10、不现实的时间期望
11、无效的的通讯
12、下属的训练和发展不充分
13、拖延、犹豫、作白日梦
14、不会说“不”
15、努力不彻底、或改变努力
16、自己做缠人过多的细节
17、员工不足或工作不力
18、社会的、闲在的谈话
19、缺少自律
20、保持优越感
21、错误的倾听
22、缺少反馈
23、争议、个人问题
24、忧虑、恐惧、焦急
25、不充分的计划、错误的变更
26、等待
27、记忆本身
28、差的记忆
29、对结果行为的迷惑
30、疲劳、讨厌
31、责备其它
32、压力、紧张
33、不充分的工具与设备
34、公司策略
35、不充分的登记系统
36、过多的文案工作、邮件、读物
37、宠物、外界活动
38、不耐烦、草率
39、不懂该做先做的事

2007年7月20日

[ZT]拖延:一种不好的习惯

source:http://www.yeeyan.com/articles/view/3244/1247

在生活中有很多事情会妨碍我们获得成功,而其中最能妨碍我们的也许是拖延的习惯。拖延者妨碍的是他们自已,他们把妨碍物放在他们自己的道路上,他们实际上选择了伤害他们工作效率的道路。

人们为什么会这样做呢?我曾访问两位世界知名的研究拖延的专家:Joseph Ferrari, Ph.D.,,芝加哥的De Paul大学心理学方面的副教授以及Timorthy Pychyl,加拿大渥太华市的Carleton大学的心理学副教授。他们都不是拖延者,并且都很快回答了我提出的很多问题。

1. 百分之二十的人认为他们是慢性的拖延者。对他们而言,拖延是一种生活方式,尽管这并不是一种好的生活方式。并且拖延发生在生活的所有领域。拖延者往往不及时付账单,错过买音乐会的门票,不去兑现礼券或支票,总是晚报所得税申报表,或是直到圣诞节前夕才想到去买圣诞节所须商品。

2. 这并非是微不足道的问题,尽管从文化的角度上而言这并不是多么严重的问题,但它代表了一个深层次的自我约束的问题。并且,美国与其它国家相比,拖延代表了更多的问题,原因是我们非常挑剔;即使我们相信理由是真的,我们也不允许人们以各种理由辩解

3. 拖延并不是一个时间管理或计划管理方面的问题。尽管拖延者比其他人更乐观,他们对时间的估计能力并与其他人并没有什么不同。(后边这句没译出来)

4 拖延者并不是天生的。拖延的习惯是在家庭环境中形成的,但家庭环境并不直接导致拖延。拖延往往来源于家长独裁式的家庭。拥有绝对控制权的父亲往往阻碍了子女自我约束能力的发展,阻碍了他们形成自己的意图并学会将这种意图付诸实践的能力。拖延甚至是一种叛逆的表现,这种表现是在这种家庭环境下产生的表现之一。并且,在这种家庭环境中,拖延者更愿意向朋友(而非父母)寻求帮助,并且,他们的朋友可能会使拖延者的拖延变得更为严重,因为朋友对拖延者的理由总是很宽容。

5 在饮酒的人群中,拖延者往往能消费更多的酒。拖延者喝的酒往往比他开始想喝的量要多----一个自我约束方面的小问题的表现,这种表现(对拖延者的影响)大大超越了拖延的情况发生时一些反复出现的情形对拖延者的影响,并且这种表现会导致通过滥用物质得到解脱。

6 拖延者往往自欺欺人。比如,“我更愿意明天做这件事”,或者 “如果有压力我会干得更好”。但事实上到了第二天他们也没有紧迫感、也没有在压力之下干的更好。另外,为了保持自我感觉良好,他们会劝自己说“这事不重要”。拖延者偏爱的另外一大谎言是:时间的压力让他们更有创造力。不幸的是,他们最终并没有更具创造力;那只是他们的感觉而已。他们最终浪费的(时间)资源。

2007年7月16日

[ZT]windows下的83个开源软件

windows下的83个开源软件

以下内容翻译自https://wiki.ubuntu.com/LoopList,可能有部分翻译的不是很准确(因为有些东西我也不知道是干什么用的)。这些全部是windows下的开源软件。每个领域最多会列出两个最好的软件。

个人电脑程序

通讯类

邮件程序= Thunderbird

对比: Microsoft Outlook

通用即时通讯软件 = Gaim

对比: Trillian

通用即时通讯软件= Miranda IM

对比: Trillian

Web浏览器 = FireFox

对比: Microsoft Internet Explorer

IP电话 = OpenWengo

对比: Skype

教育

学习游戏 = Childsplay

对比: 未知

天文馆 = Stellarium

对比: 未知

宇宙模拟 = Celestia

对比: 未知

飞行模拟 = FlightGear

对比: Fly!

打字训练 = Tux Typing

对比: 未知

绘图程序 = Tux Paint

对比: KidPix

经济类

个人账目 = Grisbi

对比: 未知

财政: TurboCash

对比: Quicken Quickbooks

开发类

框架/平台 = Mono

对比: Microsoft .NET Framework, Java

完整开发环境 = Eclipse

对比: Microsoft Visual Studio

完整开发环境 for C# and VB.NET = SharpDevelop

对比: Microsoft Visual Studio, Borland IDE

Windows安装程序制作 = Nullsoft Scriptable Install System, Inno Setup

对比: InstallShield, Microsoft Installer

游戏类

3D 宇宙模拟 = Vega Strike, Epiar

对比: Eve-Online

3D 实时坦克大战 = BZFlag

对比: 未知

3D 回合制坦克大战 = Scorched 3D

对比: 未知

3D 海盗冒险 = Crown and Cutlass

对比: Pirates!

宇宙射击 = Kobo Deluxe

对比: 未知

台球 = FooBillard

对比: 未知

第一人称射击 = Cube, Nexiuz

对比: Quake, Doom, Unreal

疯狂小旅鼠 = Pingus

对比: Lemmings

战略指挥 = Penguin Command

对比: 未知

大型多人在线RPG = PlaneShift

对比: Everquest

赛车 = PlanetPenguin Racer (f.k.a. TuxRacer)

对比: 未知

冒险 = JavaRisk

对比: 未知

类Tron游戏 = Armagetron Advanced

对比: 未知

回合制假象策略 = Battle for Wesnoth

对比: Age of Wonders, Heroes of Might and Magic, Warlords

策略类(建设) = LinCity-NG OpenTTD

对比: SimCity, Transport Tycoon Deluxe

回合制策略(科幻) = UFO: Alien Invasion

对比: X-Com

制作类

数据库(桌面) = OpenOffice (Base)

对比: Microsoft Office (Access)

脑图 = FreeMind

对比: Mindjet MindManager, Inspiration

PDF制作 = PDF Creator

对比: Adobe Acrobat

演示 = OpenOffice (Impress)

对比: Microsoft Office (Powerpoint)

报告制作 = JasperReports

对比: Crystal Reports

表格 = OpenOffice (Calc)

对比: Microsoft Office (Excel)

文字处理 = OpenOffice (Writer)

对比: Microsoft Office (Word)

科学文字处理 = Lyx (Latex gui frontend)

对比: Scientific Word

管理类

Gantt制图 = GanttProject

对比: Microsoft Project

项目管理 = OpenWorkbench

对比: Microsoft Project

杂类

Animal Shelter Manager = Animal Shelter Manager

对比: 未知

IA-32 (x86) PC 模拟器 = Bochs

对比: 未知

Linux环境 = Cygwin

对比: 未知

处方管理 = Gourmet Recipe Manager

对比: 未知

屏幕保护 = Really Slick Screensavers

对比: Unkown

翻译工具 = OmegaT

对比: Unkown

多媒体

3D

3D 动画 = Blender, Wings 3D

对比: Alias Maya

3D 图像 = POV-Ray

对比: 未知

3D 游戏开发工具包 = Crystal Space, Ogre3d

对比: 未知

音频类

音频编辑 = Audacity

对比: Adobe Audition

音频播放 = Coolplayer, Zinf

对比: WinAMP, Windows Media Player

MP3抓取= CDex

对比: 未知

音量标准化 = MP3Gain

对比: 未知

绘图类

图表编辑 = Dia

对比: Microsoft Visio

图像编辑 = Gimp

对比: Adobe Photoshop, Corel Paint Shop

矢量绘图 = Inkscape

对比: Adobe Illustrator, CorelDraw

矢量绘图= Sodipodi

对比: Adobe Illustrator, CorelDraw

其他

媒体播放 = VLC media player

对比: Windows Media Player, PowerLink PowerDVD, Intervideo WinDVD

网页设计 = Nvu

对比: Microsoft Frontpage, Macromedia Dreamweaver

视频

视频捕捉 = VirtualDub

对比: 未知

视频编辑 = Jashaka

对比: Adobe After Effects, Pinnacle Studio, Apple Final Cut

安全类

802.1x 连接 = SecureW2

对比: 未知

杀间谍软件 = Winpooch

对比: 未知

杀毒软件 = ClamWin

对比: 未知

网络协议分析 = Ethereal

对比: Sniffer

密码安全 = KeePass Password Safe, Password Safe

对比: 未知

VPN连接 = OpenVPN client GUI for Windows

对比: Cisco VPN client, Nortel VPN client

工具类

文件压缩 = 7-Zip

对比: WinZip

FTP连接 = Filezilla FTP client

对比: SmartFTP, BulletProof FTP

统计磁盘使用情况 = WinDirStat

对比: 未知

服务器软件

数据库类

数据库服务器 = Firebird, MySQL, PostgreSQL

对比: Microsoft SQL server, Oracle database

文件服务器类

FTP服务器 = Filezilla FTP server

对比: 未知

信息类

Email服务器 = hMailServer

对比: Microsoft Exchange server, Novell GroupWise server

即时通讯服务器 = Jive Messenger

对比: Novell GroupWise Messenger

安全类

入侵侦查系统 (IDS) = Snort

对比: 未知

VPN服务器 = OpenVPN

对比: Cisco VPN

Web类

应用程序服务器 = JBoss

对比: BEA Weblogic, IBM Websphere

富网络程序服务器 = OpenLaszlo

对比: Macromedia Flex

统计 = AWStats

对比: 未知

Web服务器r = Apache

对比: Microsoft Internet Information Services (ISS)

2007年6月25日

对Weka的深入理解

Weka是一个很好的东西,对于数据挖掘的研究人员,它是一把利刃,对于自然语言处理的研究人员,它是一把尖刀。非常具体的深入的说明,请看《数据挖掘:使用机器学习技术》一书,网上有英文版的,下载地址http://wekacn.gbaopan.com/files/c0f5ee1f43914f8faf3ed9c393f477f2.gbp,中文版的可以在China-pub上买到。

自己很早以前就知道Weka了的,但是被卡在Weka占用大量内存而导致机器死机。近日研读了Weka中文站论坛 上的所有帖子。顿时发现自己对Weka的认识原先是那么的钱。当然,现在我对Weka的认识也是很浅的。Weka最吸引人的地方就是开源,可以自己完成一些算法来嵌入Weka中,从而进行非常公平的对比。在了解了Weka的这种特点后,我的犹豫是否应该学习Java。呵呵,还是暂时不学为好的。因为俺的精力实在有限得很的。等将来有机会深入研究机器学习了再来学习不迟。

说说俺新认识到的Weka的一些内容吧。Weka分类算法中ZeroR表示对数据集上取比例最大的类别标签来作为默认的分类结果。这个模块非常的简单,但是意义非凡,它确定了一个数据集上做分类的baseline。在我们的自然语言处理研究中Tim老师强调过分析这种Baseline的重要性的。

分类算法中的OneR是一个神奇的方法,神奇在于它很简单,往往比能达到的最好分类性能差一点,但是速度却是最快的。基本思想就是对数据集上的各个属性创建单层的决策树,然后计算训练集上能达到的错误率,最终选择错误率最低的属性产生的单层决策树来作为分类策略。

Weka中SMO分类算法可以看成是SVM算法的实现。Weka能调用Libsvm,但是Weka只是提供了Libsvm的Wrapper调用机制,必须安装Libsvm后将附带的jar路径添加到Weka的启动路径中。在Weka的平台下调用Libsvm可以非常方便的和其他算法进行同一配置下的比较。

Weka的特征选择算法不单单可以直接作为研究内容,还可以在数据的预处理阶段完成相关特征选择的处理。在特征较多的情况下,进行特征选择往往能使得分类器的泛化能力大大提高。

Weka可以方便的进行命令行调用。如果用Java或者Jpython编程,还能进行更加深入的调用。Weka的命令行调用参数很多,采用系统调用的方法可以采用几乎任何编程语言进行调用,唯一需要仔细处理的就是用程序写好即将被处理的arff数据文件。

Weka的一个问题是可能会暂用非常大的内存,使得问题无法处理。两个可行的方案是:1、将数据进行采样处理或者将批处理策略改为更新策略;2、采用分布式处理,Weka自带了一种分布式处理的机制,可以将一个机器难以处理的问题分摊到多个机器上,实现分布式的处理。

Weka被封装在了著名的自然语言处理平台Gate中,可以结合Gate的相关处理模块实现几乎理想的文本挖掘的工作。


2007年6月24日

自然语言处理的变相和相变

随机的往图中添加边。从这点出发,爱多士建立了很多相变的简单模型。相变是很多的自然现象。对了“自然”的自然语言处理,是否也存在类似的机制导致出现相变呢?我们先来回顾一下自然语言处理研究的变相。

传统意义上,自然语言处理的研究人员都认为自然语言处理的研究开始于基于规则的方法,后来引入大规模语料库出现了基于统计的潮流,可以说近20年来,统计方法在自然语言处理中占据了统治地位,而且统计方法的性能越来越超出基于规则的方法。但是,随着研究的深入,又有越来越多的研究人员意识到纯粹的统计方法是有瓶颈的。这个瓶颈的解决必须依靠基于规则的方法或者基于知识库的方法来进行解决。于是又开始出现了越来越多的所谓的统计和规则相结合的策略。不外乎有如下两种结合方式:过滤筛选、融入到统计中。前者是在统计方法的前处理阶段以及后处理阶段将很多不适合的样本进行剔除,从而保证最终结果的准确率。这种策略适当的牺牲了召回率,但是却大幅提高了精确率,总体看来,还是使得F值得到了提高。但是这种策略本质上没有完美而简练的体现规则和统计的深层结合。第二种融合方式就是将所谓的规则知识融入到统计过程中。本质上就是将知识信息转变未统计方法能够覆盖的“属性-值”形式的规范化数据。这种形式的早期引入确实产生了很好的效果,但是不久又出现了新的瓶颈。原因在于这种能被统计覆盖的“属性-值”表示方式使得知识没有被充分得使用。总之,现在再次出现了新的瓶颈。那么如何解决这个瓶颈呢?无数的研究者正在思考着。新近看到的ACL2007主会议的一篇论文“Learning Expressive Models for Word Sense Disambiguation”提出了一种新的方案:Inductive Logic Programming。这种方法能够很好的将需要利用的知识之间的关系。更具体的思想,等仔细研读后和大家分享。

仔细考察自然语言处理的研究策略变化,那什么东西已经或者可能导致自然语言处理研究的相变呢?统计的引入?Inductive Logic Programming? 我不得而知。

联想共指消解的研究,存在这种导致相变的机制么?我想肯定是存在的。具体的需要我们不断的思考和探索。

2007年6月23日

品读:保罗.爱多士

近日品读了《我的大脑敞开了:天才数学家保罗.爱多士传奇》。这是一本让我兴奋的书,不仅仅是因为书写得很好,还因为从中感受到了很多,也让我联想到了自然语言处理研究中的一些现象。如果你没有读过这本书,非常推荐你看一下。

保罗.爱多士是20世纪世界上最伟大的数学家之一,无疑也是最古怪独特的数学家之一。爱多士出生于数学人才辈出的匈牙利、科学精英荟萃的犹太家庭,从小就有神童之称,17岁发表数学论文,一生之中与450多人合作,发表了1500篇论文著作。爱多士一生命运多舛,身为犹太人遭纳粹迫害,不得不亡命海外,50年代因与华罗庚通信而被怀疑通共亲华,被美国麦卡锡主义者赶出美国,从此终身漂泊,浪迹天涯。爱多士终身未娶,没有固定职业,他把一生献给了科学事业。他一天工作十八九个小时,一年四季奔波于世界各地,与数学界同行探讨数学难题。爱多士的大脑里整日装满了数学问题、定理、猜想、证明。本书也介绍了爱多士关注的一些世界著名难题:如歌德巴赫猜想、费马大定理,以及数学史上德许多轶闻趣事。爱多士史一个有正义感德科学家,他爱祖国、爱母亲、爱孩子。对他来说,数学是他德生命、他的一切。他有一个开放的大脑、一个丰富多彩的人生。

通读这本书,我了解到了爱多士工作的一个主题:有序与混乱之间的微妙关系。对这一主题最清楚的陈述可以在他关于拉姆塞理论的著作中找到,拉姆塞理论表明了完全的无序是不可能的。正如夜空的星星,你总能从中找到一些特殊的形状。无序之中必定隐藏着某种有序。1959年,爱多士与瑞尼通过寻找混乱的随机图中的有序现象来研究这一问题,随机图是精心发明的无序结构。使他们感到惊讶的是,即使在最随机的情况下,有序的结构仍会自发的产生出来。

1947年,为了证明有关拉姆塞的一条定理,爱多士产生了研究随机图的奇异想法。顾名思义,随机图不是通过细心的设计而是由随机事件来构造的。试想有个神经失常的土木工程师要决定在哪些城市之间铺设连接道路。他用的方法是投钱币。例如;如果出现正面,则在阿尔巴尼与波士顿之间建一条路,否则就不用建。这样得到的路的偶然网络就是一个随机图。

爱多士和瑞尼最有创造性和最深远的合作是1959年撰写的,包含在神秘的标题“随机图论进展”之下的一系列经典论文。他们合写这些论文只是为了满足他们纯粹的数学好奇心,但这些文章可能掌握着解释一大类现实世界现象,包括生命起源的钥匙。

爱多士与瑞尼分析的情况是前面提到的土木工程师狂想曲的变奏。假定土木工程师现在的任务是要修筑链接一大批(譬如说10000个)城市的道路。他首先忽略距离,随机的选择两个城市并在它们之间筑一条路。然后随机的选择两个城市并筑另一条路。工程师按这一方法进行下去,但当两个城市之间已经有路连接,就不再在它们间筑路。

起初只有少数城市之间有路相连,但当工程师逐渐加筑一些路后,就会形成一些小小的相互链接的城市网。生活在这些城市网中的人可以沿着一系列路驱车到圈内的其他任何一个城市去。爱多士与瑞尼发现,开始时出现的城市圈是小规模和分散的。当工程师加修了更多的路时,圈的规模将缓慢的变大,圈中的城市变得更多的相互连接。直到路的条数增加到使半数的城市都被连接起来之前,情况尚无太大变化。但此后,只要添加极少数的几条路,奇迹就会突然出现。很多原先孤立的圈子将会变得相互联结而形成一个几乎包括了所有城市的巨大圈子。

由各个孤立的小圈向单个大圈的迅速转变在许多自然现象中有惊人的类似。例如,水的突然结冰或交通的堵塞。这类现象,即所谓的相变,长期以来一直使科学家们迷惑不解。爱多士与瑞尼出于纯粹的数学好奇心而进行的随机图研究,提供了一个可以阐明相变机制的简单模型。“这篇文章开辟了整个领域,”爱多士的弟子斯潘塞评论到,“回过头来看看,你就会明白:所有的发展都源于这样一个想法,即随机的增加边之后会发生什么。”自从爱多士与瑞尼关于随机图的文章发表以来,已有成百篇的其他文章,总多的专著和国际会议致力于这一领域的研究。

作为纯粹的数学家,他们并不是完全不了解他们研究的应用意义。在他们的原始论文中写到,研究随机图中结构的突然变化“不仅仅是纯粹的出于数学上的兴趣。实际上,图的变化可以当作一国或其他某个单位的一个交通网络(铁路、公路或电子网络系统等)的大为简化的模型……似乎可以这样说,通过较为复杂的网络结构的随机增长的考虑”,我们可以得到复杂的显示增长过程的相当合理的模型(例如,由不同类型的联系组成的复杂交通网络,以及甚至生命的有机结构,等等)”。40多年后,这一论点被证明是非常有远见的。桑塔费研究所的考夫曼(Stuart Kauffman)很大程度上依赖随机图的演化建立了他的令人信服的生命起源理论。在考夫曼的模型中,生命起源于混乱的原始分子群,这与爱多士和瑞尼随机图的演化模型中的“圈”(cluster)的出现安有着相同的必然性。

2007年6月22日

What's new in Weka 3.5.6

What's new in the developer version?
- nearest neighbor search got re-organized and
extended:
weka.core.neighboursearch.BallTree
weka.core.neighboursearch.CoverTree
weka.core.neighboursearch.KDTree
weka.core.neighboursearch.LinearNNSearch

- tokenizers for the StringToWordVector are now
GOE objects and the NGram tokenizer got added:
weka.core.tokenizers.AlphabeticTokenizer
weka.core.tokenizers.NGramTokenizer
weka.core.tokenizers.WordTokenizer

- new classifiers:
weka.classifiers.bayes.NaiveBayesMultinomialUpdateable
weka.classifiers.misc.SerializedClassifier

- a new kernel:
weka.classifiers.functions.supportVector.Puk

- new associators:
weka.associations.FilteredAssociator
weka.associations.GeneralizedSequentialPatterns

- new filters:
weka.filters.unsupervised.attribute.KernelFilter
weka.filters.unsupervised.attribute.NominalToString

link: Weka 3: Data Mining Software in Java


It is more suitable for our research!