实验室例会,上到一半之后发现今天下午第二节课是Android,上次两节Android都没跟中秋碰头,这次又不能碰头了,然 后就赶紧给中秋发了个短信,说我在开会,晚上约个时间再谈。正好也称这一下午加一晚上的时间把那三篇论文温习一遍,然后把CRF、MRF再看看,不过果然 还是没于看懂,晚上吃完饭回来打算找学长问,不过学长吃饭去了还没有回来,就自己看那篇综述。
 
等学
瑞吉师兄回来之后就跟师兄到会议室讨MRF还有这个题目。其实之前对MRF一直存在误解,这是主要障碍,以前一直以为每个节点都代表一种lable
configuration,这样不同的Y之间会有概率关系,而且满足马尔科夫性,不过越想越不对劲。后来师兄告诉我,我才明白,原来整个图才是
Lable
configuration,每一个Y不是向量,是一个Configuration的一个标签,这样不用标签之间存在着相互决定相互影响的关系,比如说对
于NER来说,上一个标签是B_xx,下一个标签一定(或很有可能)就是I_xx或者E_xx,如果上一个状态是I_xx,那么下一个状态一定(或很有可
能)就是I_xx或者E_xx,这样就都说通了。随机场的运行机制跟高中物理中的静电场差不多,顺着场强最大的方向一直走,带电粒子就会获得最大的能量,
对我们来说也就是得到了最大的概率。这个概率一路走来所经过的路径,就是最佳路径,就是我们说的最可能的Label
Configuration。学习的过程就是根据观测数据,用最大似然估计等估计方法来猜测,能让我看到这套观测数据的最可能Label
Configuration是什么样的。
 
然后我们开始讨论KDD的那个问题,感觉姜还是老的辣,我
自己抠了好几天大脑都没什么突破,结果跟瑞吉师兄一讨论就感觉清澈很多了,而且瑞吉师兄帮助我对于识别atomic
cluster的方法进行了扩展,之前一直都在同一篇paper里面转悠,看怎么能从一篇paper里面识别出co-author的信息来,之前的想法是
如果一个歧义协作者跟其他某一个无歧义协作者的机构相同就认定一定是这个歧意作者写的,不过这个方法很有限,这种恰好的情况数量比较少。然后师兄的这种方
法进行了扩展,用多篇有作者起义的文章进行相互校验。比如当前这篇文章有无歧义作者,那么在其他文章中搜看这个无歧义作者有没有跟其中某个尤其以作者合作
过,如果找到这样的纪录那么就果断认为是这个无歧义作者写的。
 
最后又为我提出了一个可行度比较高的
方案,就是利用标注扩展的原理,找出文章之间的相似度,然后以作者为标签进行标注。通过上面的方法找出准确率比较高的某篇文章的标注没后通过相似度矩阵进
行反复迭代,最后就会沉淀出来的格局就是结果。不过这样所有文章一起算的话运算会有点大,毕竟作者数量还很多,而且标注向量太稀疏,所以打算首先对每个待
消歧作者的所有待消文章进行标签扩展,如果效果不好的话再想别的办法。
 
感觉今天很有收获,晚上十一点多才到公寓,然后给中求发短信问他是不是十一点老地方,他说已经睡下了,改天吧。我说恩,好吧。
 
夜里在自习室继续看那篇综述看到两点多,感觉现在非常清醒。

2013.5.21 - KDD第三十三天的更多相关文章

  1. 2013.5.23 - KDD第三十五天

    看完睡不觉得世间有点虚度,然后就构思了一下带带回儿去找中秋要跟她说的事情,大概就是这样的:   我 打算用paper来计算人与人之间的距离,比如说我跟郑茂和写过一篇文章,然后郑茂根韩冰和写过一篇文章, ...

  2. FreeSql (三十三)CodeFirst 类型映射

    前面有介绍过几篇 CodeFirst 内容文章,有 <(二)自动迁移实体>(https://www.cnblogs.com/FreeSql/p/11531301.html) <(三) ...

  3. 第三十三个知识点:Bellcore攻击是如何攻击使用CRT的RSA的?

    第三十三个知识点:Bellcore攻击是如何攻击使用CRT的RSA的? 注意:这篇博客是由follow论密码计算中消除错误的重要性(On the importance of Eliminating E ...

  4. COJ967 WZJ的数据结构(负三十三)

    WZJ的数据结构(负三十三) 难度级别:C: 运行时间限制:7000ms: 运行空间限制:262144KB: 代码长度限制:2000000B 试题描述 请你设计一个数据结构,完成以下功能: 给定一个大 ...

  5. NeHe OpenGL教程 第三十三课:TGA文件

    转自[翻译]NeHe OpenGL 教程 前言 声明,此 NeHe OpenGL教程系列文章由51博客yarin翻译(2010-08-19),本博客为转载并稍加整理与修改.对NeHe的OpenGL管线 ...

  6. COJ 0967 WZJ的数据结构(负三十三)

    WZJ的数据结构(负三十三) 难度级别:E: 运行时间限制:7000ms: 运行空间限制:262144KB: 代码长度限制:2000000B 试题描述 请你设计一个数据结构,完成以下功能: 给定一个大 ...

  7. 三十三、Java图形化界面设计——布局管理器之null布局(空布局)

    摘自http://blog.csdn.net/liujun13579/article/details/7774267 三十三.Java图形化界面设计--布局管理器之null布局(空布局) 一般容器都有 ...

  8. JAVA之旅(三十三)——TCP传输,互相(伤害)传输,复制文件,上传图片,多并发上传,多并发登录

    JAVA之旅(三十三)--TCP传输,互相(伤害)传输,复制文件,上传图片,多并发上传,多并发登录 我们继续网络编程 一.TCP 说完UDP,我们就来说下我们应该重点掌握的TCP了 TCP传输 Soc ...

  9. Gradle 1.12用户指南翻译——第三十三章. PMD 插件

    本文由CSDN博客万一博主翻译,其他章节的翻译请参见: http://blog.csdn.net/column/details/gradle-translation.html 翻译项目请关注Githu ...

随机推荐

  1. Python - Django - AJAX 实现 POST 请求

    index.html: <input type="text" id="i1">+ <input type="text" i ...

  2. 【计算机视觉】图像着色(Image Colorization)

    (Sometimes technology enhances art. Sometimes it vandalizes art. --- 有时技术会增强艺术,有时它破坏了艺术.) 着色黑白电影是一个可 ...

  3. js set集合转数组 Array.from的使用方法

    1.set集合转化Array数组  注意:这个可以使用过滤数组中的重复的元素 你可以先把数组转化为set集合 然后在把这个集合通过Array.from这个方法把集合在转化为数组 var set = n ...

  4. [LeetCode] 316. Remove Duplicate Letters 移除重复字母

    Given a string which contains only lowercase letters, remove duplicate letters so that every letter ...

  5. mysql查询之上升的温度,有趣的电影,超过5名学生的课,大国,反转性别, 换座位

    最近发现一个网站 力扣 查看 上面有很多算法和数据库的题目,做了一下,发现自己平时都疏忽了,因此边做边记录下来 1.上升的温度 给定一个 Weather 表,编写一个 SQL 查询,来查找与之前(昨天 ...

  6. 【Android Studio】Android实现跳转功能

    最近在玩Esp32,需要APP,顺带学了下这方面的东西. 主要实现功能: 从主  mainActivity  跳转到otherActivity. 新建一个hello工程,添加 otherActivit ...

  7. Docker的基础教程(基于CentOS)

    1.查看版本 Docker 要求 CentOS 系统的内核版本高于 3.10 ,查看本页面的前提条件来验证你的CentOS 版本是否支持 Docker . 通过 uname -r 命令查看你当前的内核 ...

  8. 【LeetCode】四数之和【排序,固定k1,k2,二分寻找k3和k4】

    给定一个包含 n 个整数的数组 nums 和一个目标值 target,判断 nums 中是否存在四个元素 a,b,c 和 d ,使得 a + b + c + d 的值与 target 相等?找出所有满 ...

  9. [转帖]Redis、Memcache和MongoDB的区别

    Redis.Memcache和MongoDB的区别 https://www.cnblogs.com/tuyile006/p/6382062.html >>Memcached Memcach ...

  10. sync包 — 汇总

    sync包 package main; import ( "time" "fmt" ) func main() { //time.Time代表一个纳秒精度的时间 ...