<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="zh-Hans-CN">
	<id>http://hlt.suda.edu.cn/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Zhli</id>
	<title>SUDA-HLT - 用户贡献 [zh-cn]</title>
	<link rel="self" type="application/atom+xml" href="http://hlt.suda.edu.cn/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Zhli"/>
	<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php/%E7%89%B9%E6%AE%8A:%E7%94%A8%E6%88%B7%E8%B4%A1%E7%8C%AE/Zhli"/>
	<updated>2026-09-22T04:47:22Z</updated>
	<subtitle>用户贡献</subtitle>
	<generator>MediaWiki 1.35.2</generator>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6240</id>
		<title>Linux-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6240"/>
		<updated>2026-09-16T02:11:41Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 板书和笔记 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 课程安排 ==&lt;br /&gt;
* 老师: [http://web.suda.edu.cn/zhli13/ 李正华]&lt;br /&gt;
* 助教：顾天宇&lt;br /&gt;
* 计24计科1班,计24计科2班（大三上）&lt;br /&gt;
* 专业选修课&lt;br /&gt;
* 上课时间和地点&lt;br /&gt;
** QQ群：705869759&lt;br /&gt;
** 理论课：周一 6-7节 14:00-15:35 逸夫楼334  【1-17周】&lt;br /&gt;
** 实践课：周三 1-2节 8:00-9:35 理工楼243 【单周】&lt;br /&gt;
* 课程成绩构成（拟）：平时10%（考勤等）、实验成绩30%（实验报告、随堂考试）、期末60%（闭卷）&lt;br /&gt;
&lt;br /&gt;
== 注意事项 ==&lt;br /&gt;
* &amp;lt;span style=&amp;quot;color: #ff0000;&amp;quot;&amp;gt;上机课做学习无关的事情，发现则平时和实验成绩为0 &amp;lt;/span&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 自学资料 ==&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-video-notes 2018年春季上课视频和笔记]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2025-fall 2025年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-fall 2024年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-spring 2024年春上课板书]&lt;br /&gt;
&lt;br /&gt;
== 参考书 ==&lt;br /&gt;
&lt;br /&gt;
* 有问题，问大模型！&lt;br /&gt;
&lt;br /&gt;
* Unix &amp;amp; Linux大学教程 哈恩(Harley Hahn) (作者), 张杰良 (译者) 【基础内容、讲得比较细；图书馆可以借】&lt;br /&gt;
&lt;br /&gt;
* 跟阿铭学Linux 李世明 人民邮电出版社 【难度适中，我们只学前半部分】&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 板书和笔记 ==&lt;br /&gt;
&lt;br /&gt;
=== TODO === &lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
arr+=(3) 【数组增加一个元素】&lt;br /&gt;
&lt;br /&gt;
b=($(cat a.txt)) 【外面的()必须有，否则 b 就不是一个数组了。而是一个字符串了】&lt;br /&gt;
&lt;br /&gt;
a=($(echo 'a b')) 【a 是一个数组了】&lt;br /&gt;
&lt;br /&gt;
read -a arr &amp;lt;&amp;lt;&amp;lt; 'a b c'  【读入数组，arr 会包含三个元素，默认空白符为分隔符】&lt;br /&gt;
&lt;br /&gt;
IFS=',' read -a arr &amp;lt;&amp;lt;&amp;lt; $x  【默认是空格，IFS 可以改】【不会跨行的】&lt;br /&gt;
&lt;br /&gt;
IFS='\n' read -a arr &amp;lt; a.txt 【不会跨行的，只会处理第一行？？】&lt;br /&gt;
&lt;br /&gt;
read x y z &amp;lt;&amp;lt;&amp;lt; '1 2 3' 【第三个变量】&lt;br /&gt;
&lt;br /&gt;
read -a arr &amp;lt; a.txt 【只处理第一行】&lt;br /&gt;
IFS=','&lt;br /&gt;
while read -a arr; do echo ${arr[1]}; done &amp;lt; a.txt 【每一行输出一次】&lt;br /&gt;
&lt;br /&gt;
while read name; do echo $name; done &amp;lt; a.txt  【read 和重定向的配合】&lt;br /&gt;
&lt;br /&gt;
while read -d ',' name; do echo $name; done &amp;lt; a.txt 【-d 是 delimiter，默认是换行符，没遇到一个 delimiter，就会返回一个，最后一个元素后面必须有 delimiter】&lt;br /&gt;
a.txt: a,b,c,&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
awk 中变量直接写，不用取值符，如 print x, y, z&lt;br /&gt;
&lt;br /&gt;
awk 'BEGIN {FS=&amp;quot;,&amp;quot;;OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt&lt;br /&gt;
&lt;br /&gt;
awk -F',' 'BEGIN {OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt&lt;br /&gt;
&lt;br /&gt;
awk -F'\n\r' '{print NF}' a.txt  【每一行一个记录，每个记录只有一个 field，因此会输出多个 1，一行对应一个】&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
sed 's/a/A/g' &amp;lt;&amp;lt;&amp;lt; 'aaa'  字符串的重定向，很有用，应该讲！&lt;br /&gt;
&lt;br /&gt;
a=($(sed 's/,/ /g' &amp;lt;&amp;lt;&amp;lt; 'a,b')) 【a 是数组了】&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Lesson 2（2026.9.14；第2周） ===&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
Linux-2026-fall-week2-merged.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* shell基本使用、父shell、子shell&lt;br /&gt;
* Shell提示符、ls命令、cd命令&lt;br /&gt;
* 命令语法、命令行参数、python的sys.argv接收参数&lt;br /&gt;
* 所使用到的命令&lt;br /&gt;
 1998  bc&lt;br /&gt;
 1999  echo 'hi'&lt;br /&gt;
 2000  x=7&lt;br /&gt;
 2001  y='hello world'&lt;br /&gt;
 2002  echo $x&lt;br /&gt;
 2003  echo $y&lt;br /&gt;
 2004  echo $$&lt;br /&gt;
 2005  bash&lt;br /&gt;
 2006  /bin空白/echo $$ （替换&amp;quot;空白&amp;quot;为&amp;quot;&amp;quot;）&lt;br /&gt;
 2007  man echo&lt;br /&gt;
 2008  ls&lt;br /&gt;
 2009  ls -l&lt;br /&gt;
 2010  cd linux/&lt;br /&gt;
 2011  ls&lt;br /&gt;
 2012  ls -l&lt;br /&gt;
 2013  cd awk/&lt;br /&gt;
 2014  ls&lt;br /&gt;
 2015  ls -l&lt;br /&gt;
 2016  ls -a&lt;br /&gt;
 2017  ls&lt;br /&gt;
 2018  s&lt;br /&gt;
 2019  ls -a&lt;br /&gt;
 2020  cd ..&lt;br /&gt;
 2021  find cmd&lt;br /&gt;
 2022  find . -name '*.py'&lt;br /&gt;
 2023  vi cmdline-arg.py&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Lesson 1（2026.9.7；第1周） ===&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
Linux-2026-fall-week1-merged.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* 课程介绍、个人介绍&lt;br /&gt;
* Linux介绍、安装&lt;br /&gt;
* 运行状态、init&lt;br /&gt;
* 图形界面GUI、文字界面CLI&lt;br /&gt;
* 系统组成、shell初介绍&lt;br /&gt;
* 所使用到的命令&lt;br /&gt;
 1984  ps afx | egrep gnome&lt;br /&gt;
 1985  ps afx | egrep kde&lt;br /&gt;
 1986  sudo init 3&lt;br /&gt;
 1988  ps afx | egrep bash&lt;br /&gt;
 1989  exit&lt;br /&gt;
 1990  man init&lt;br /&gt;
 1991  echo $SHELL&lt;br /&gt;
 1992  ps afx | egrep bash&lt;br /&gt;
 1993  bash&lt;br /&gt;
 1994  ps afx | egrep bash&lt;br /&gt;
 1995  exit&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6237</id>
		<title>Linux-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6237"/>
		<updated>2026-09-09T01:30:49Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 课程安排 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 课程安排 ==&lt;br /&gt;
* 老师: [http://web.suda.edu.cn/zhli13/ 李正华]&lt;br /&gt;
* 助教：顾天宇&lt;br /&gt;
* 计24计科1班,计24计科2班（大三上）&lt;br /&gt;
* 专业选修课&lt;br /&gt;
* 上课时间和地点&lt;br /&gt;
** QQ群：705869759&lt;br /&gt;
** 理论课：周一 6-7节 14:00-15:35 逸夫楼334  【1-17周】&lt;br /&gt;
** 实践课：周三 1-2节 8:00-9:35 理工楼243 【单周】&lt;br /&gt;
* 课程成绩构成（拟）：平时10%（考勤等）、实验成绩30%（实验报告、随堂考试）、期末60%（闭卷）&lt;br /&gt;
&lt;br /&gt;
== 注意事项 ==&lt;br /&gt;
* &amp;lt;span style=&amp;quot;color: #ff0000;&amp;quot;&amp;gt;上机课做学习无关的事情，发现则平时和实验成绩为0 &amp;lt;/span&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 自学资料 ==&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-video-notes 2018年春季上课视频和笔记]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2025-fall 2025年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-fall 2024年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-spring 2024年春上课板书]&lt;br /&gt;
&lt;br /&gt;
== 参考书 ==&lt;br /&gt;
&lt;br /&gt;
* 有问题，问大模型！&lt;br /&gt;
&lt;br /&gt;
* Unix &amp;amp; Linux大学教程 哈恩(Harley Hahn) (作者), 张杰良 (译者) 【基础内容、讲得比较细；图书馆可以借】&lt;br /&gt;
&lt;br /&gt;
* 跟阿铭学Linux 李世明 人民邮电出版社 【难度适中，我们只学前半部分】&lt;br /&gt;
&lt;br /&gt;
== 板书和笔记 ==&lt;br /&gt;
&lt;br /&gt;
=== Lesson 1（2026.9.7；第1周） ===&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
Linux-2026-fall-week1-merged.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* 课程介绍、个人介绍&lt;br /&gt;
* Linux介绍、安装&lt;br /&gt;
* 运行状态、init&lt;br /&gt;
* 图形界面GUI、文字界面CLI&lt;br /&gt;
* 系统组成、shell初介绍&lt;br /&gt;
* 所使用到的命令&lt;br /&gt;
 1984  ps afx | egrep gnome&lt;br /&gt;
 1985  ps afx | egrep kde&lt;br /&gt;
 1986  sudo init 3&lt;br /&gt;
 1988  ps afx | egrep bash&lt;br /&gt;
 1989  exit&lt;br /&gt;
 1990  man init&lt;br /&gt;
 1991  echo $SHELL&lt;br /&gt;
 1992  ps afx | egrep bash&lt;br /&gt;
 1993  bash&lt;br /&gt;
 1994  ps afx | egrep bash&lt;br /&gt;
 1995  exit&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6236</id>
		<title>Writing-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6236"/>
		<updated>2026-09-08T08:04:28Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;助教： 刘为杰 2024级博士研究生&lt;br /&gt;
&lt;br /&gt;
1）示范性读论文&lt;br /&gt;
&lt;br /&gt;
2）报告2-3 个（提问情况，作为平时成绩参考）&lt;br /&gt;
&lt;br /&gt;
3）翻转课堂（讨论公众号小文章）&lt;br /&gt;
&lt;br /&gt;
语析 LAGroup 微信公众号：写什么？论文写作点评、论文解读&lt;br /&gt;
&lt;br /&gt;
== 教学规划 ==&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; &lt;br /&gt;
&lt;br /&gt;
2026/9/23	课程介绍&lt;br /&gt;
什么是科研、如何做科研&lt;br /&gt;
论文讲解和讨论（示范）&lt;br /&gt;
2026/9/30	如何听报告、做报告&lt;br /&gt;
论文讲解和讨论（示范）&lt;br /&gt;
2026/10/7	放假&lt;br /&gt;
2026/10/14	如何选论文、读论文&lt;br /&gt;
论文讲解和讨论（示范）&lt;br /&gt;
论文筛选和分组&lt;br /&gt;
2026/10/21	如何写论文笔记&lt;br /&gt;
论文讲解和讨论（1）&lt;br /&gt;
2026/10/28	如何想 idea、如何改进 idea&lt;br /&gt;
论文讲解和讨论（2）&lt;br /&gt;
2026/11/4	如何做实验、实验目录设计&lt;br /&gt;
论文讲解和讨论（3）&lt;br /&gt;
2026/11/11	如何撰写experiments&lt;br /&gt;
论文讲解和讨论（4）&lt;br /&gt;
2026/11/18	如何撰写 methods&lt;br /&gt;
论文讲解和讨论（5）&lt;br /&gt;
2026/11/25	如何撰写 related works&lt;br /&gt;
论文讲解和讨论（6）&lt;br /&gt;
2026/12/2	如何撰写introduction&lt;br /&gt;
论文讲解和讨论（7）&lt;br /&gt;
2026/12/9	如何撰写title、abstract、 conclusions&lt;br /&gt;
论文讲解和讨论（8）&lt;br /&gt;
2026/12/16	论文写作常见问题（参考文献、格式、画图、例子）&lt;br /&gt;
论文讲解和讨论（9）&lt;br /&gt;
2026/12/23	如何投稿、如何审稿&lt;br /&gt;
论文讲解和讨论（10）&lt;br /&gt;
2026/12/30	如何撰写学位论文、科研和写作规范&lt;br /&gt;
论文讲解和讨论（11）&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6233</id>
		<title>Linux-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6233"/>
		<updated>2026-09-07T01:04:22Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 课程安排 ==&lt;br /&gt;
* 老师: [http://web.suda.edu.cn/zhli13/ 李正华-hidden]&lt;br /&gt;
* 助教：顾天宇&lt;br /&gt;
* 计24计科1班,计24计科2班（大三上）&lt;br /&gt;
* 专业选修课&lt;br /&gt;
* 上课时间和地点&lt;br /&gt;
** 理论课：周一 6-7节 14:00-15:35 逸夫楼334  【1-17周】&lt;br /&gt;
** 实践课：周三 1-2节 8:00-9:35 理工楼243 【单周】&lt;br /&gt;
* 课程成绩构成（拟）：平时10%（考勤等）、实验成绩30%（实验报告、随堂考试）、期末60%（闭卷）&lt;br /&gt;
== 注意事项 ==&lt;br /&gt;
* &amp;lt;span style=&amp;quot;color: #ff0000;&amp;quot;&amp;gt;上机课做学习无关的事情，发现则平时和实验成绩为0 &amp;lt;/span&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 自学资料 ==&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-video-notes 2018年春季上课视频和笔记]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2025-fall 2025年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-fall 2024年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-spring 2024年春上课板书]&lt;br /&gt;
&lt;br /&gt;
== 参考书 ==&lt;br /&gt;
&lt;br /&gt;
* 有问题，问大模型！&lt;br /&gt;
&lt;br /&gt;
* Unix &amp;amp; Linux大学教程 哈恩(Harley Hahn) (作者), 张杰良 (译者) 【基础内容、讲得比较细；图书馆可以借】&lt;br /&gt;
&lt;br /&gt;
* 跟阿铭学Linux 李世明 人民邮电出版社 【难度适中，我们只学前半部分】&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall-hidden&amp;diff=6232</id>
		<title>Linux-2026-fall-hidden</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall-hidden&amp;diff=6232"/>
		<updated>2026-09-07T01:01:15Z</updated>

		<summary type="html">&lt;p&gt;Zhli：建立内容为“  == 零散知识点 ==   &amp;lt;nowiki&amp;gt;  awk 'BEGIN {FS=&amp;quot;,&amp;quot;;OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt  awk -F',' 'BEGIN {OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt  b=($(cat a.txt)) 【外…”的新页面&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
== 零散知识点 ==&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
awk 'BEGIN {FS=&amp;quot;,&amp;quot;;OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt&lt;br /&gt;
&lt;br /&gt;
awk -F',' 'BEGIN {OFS=&amp;quot;#&amp;quot;}; {print $1, $2}' a.txt&lt;br /&gt;
&lt;br /&gt;
b=($(cat a.txt)) 【外面的()必须有，否则 b 就不是一个数组了。而是一个字符串了】&lt;br /&gt;
&lt;br /&gt;
a=($(echo 'a b')) 【a 是一个数组了】&lt;br /&gt;
&lt;br /&gt;
sed 's/a/A/g' &amp;lt;&amp;lt;&amp;lt; 'aaa'  字符串的重定向，很有用，应该讲！&lt;br /&gt;
&lt;br /&gt;
a=($(sed 's/,/ /g' &amp;lt;&amp;lt;&amp;lt; 'a,b')) 【a 是数组了】&lt;br /&gt;
&lt;br /&gt;
while read name; do echo $name; done &amp;lt; a.txt  【read 和重定向的配合】&lt;br /&gt;
&lt;br /&gt;
while read -d ',' name; do echo $name; done &amp;lt; a.txt 【-d 是 delimiter，默认是换行符，没遇到一个 delimiter，就会返回一个，最后一个元素后面必须有 delimiter】&lt;br /&gt;
a.txt: a,b,c,&lt;br /&gt;
&lt;br /&gt;
read -a arr &amp;lt;&amp;lt;&amp;lt; 'a b c'  【读入数组，arr 会包含三个元素，默认空白符为分隔符】&lt;br /&gt;
&lt;br /&gt;
awk 中变量直接写，不用取值符，如 print x, y, z&lt;br /&gt;
&lt;br /&gt;
awk -F'\n\r' '{print NF}' a.txt  【每一行一个记录，每个记录只有一个 field，因此会输出多个 1，一行对应一个】&lt;br /&gt;
&lt;br /&gt;
IFS=',' read -a arr &amp;lt;&amp;lt;&amp;lt; $x  【默认是空格，IFS 可以改】【不会跨行的】&lt;br /&gt;
IFS='\n' read -a arr &amp;lt; a.txt 【不会跨行的，只会处理第一行？？】&lt;br /&gt;
&lt;br /&gt;
read x y z &amp;lt;&amp;lt;&amp;lt; '1 2 3' 【第三个变量】&lt;br /&gt;
&lt;br /&gt;
read -a arr &amp;lt; a.txt 【只处理第一行】&lt;br /&gt;
IFS=','&lt;br /&gt;
while read -a arr; do echo ${arr[1]}; done &amp;lt; a.txt 【每一行输出一次】&lt;br /&gt;
&lt;br /&gt;
arr+=(3) 【数组增加一个元素】&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6231</id>
		<title>Linux-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6231"/>
		<updated>2026-09-07T00:49:29Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 课程安排 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 课程安排 ==&lt;br /&gt;
* 老师: [http://web.suda.edu.cn/zhli13/ 李正华]&lt;br /&gt;
* 助教：顾天宇&lt;br /&gt;
* 计24计科1班,计24计科2班（大三上）&lt;br /&gt;
* 专业选修课&lt;br /&gt;
* 上课时间和地点&lt;br /&gt;
** 理论课：周一 6-7节 14:00-15:35 逸夫楼334  【1-17周】&lt;br /&gt;
** 实践课：周三 1-2节 8:00-9:35 理工楼243 【单周】&lt;br /&gt;
* 课程成绩构成（拟）：平时10%（考勤等）、实验成绩30%（实验报告、随堂考试）、期末60%（闭卷）&lt;br /&gt;
== 注意事项 ==&lt;br /&gt;
* &amp;lt;span style=&amp;quot;color: #ff0000;&amp;quot;&amp;gt;上机课做学习无关的事情，发现则平时和实验成绩为0 &amp;lt;/span&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 自学资料 ==&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-video-notes 2018年春季上课视频和笔记]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2025-fall 2025年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-fall 2024年秋上课板书]&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/Linux-2024-spring 2024年春上课板书]&lt;br /&gt;
&lt;br /&gt;
== 参考书 ==&lt;br /&gt;
&lt;br /&gt;
* 有问题，问大模型！&lt;br /&gt;
&lt;br /&gt;
* Unix &amp;amp; Linux大学教程 哈恩(Harley Hahn) (作者), 张杰良 (译者) 【基础内容、讲得比较细；图书馆可以借】&lt;br /&gt;
&lt;br /&gt;
* 跟阿铭学Linux 李世明 人民邮电出版社 【难度适中，我们只学前半部分】&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=English-novel-erratum-zhenghua&amp;diff=6230</id>
		<title>English-novel-erratum-zhenghua</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=English-novel-erratum-zhenghua&amp;diff=6230"/>
		<updated>2026-08-31T10:39:55Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 床头灯英语 5000 词 鲁滨逊漂流记 全英文版 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== 床头灯英语 5000 词 鲁滨逊漂流记 全英文版 ==&lt;br /&gt;
&lt;br /&gt;
其他 5000 词质量都没有这么差：吸血鬼、三十九级台阶、福尔摩斯、八十天环游地球&lt;br /&gt;
&lt;br /&gt;
gutenberg 项目网站非常好，8万本电子书 eBook&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Chapter 4&lt;br /&gt;
p113 第二段&lt;br /&gt;
[O-&amp;gt;] Oh, what *resolutions* men take when possessed with fear!”&lt;br /&gt;
we find anxiety greater*,* by much, than the evil&lt;br /&gt;
&lt;br /&gt;
p115 第一段&lt;br /&gt;
[least-&amp;gt;] lest they should not have the help of the tide&lt;br /&gt;
&lt;br /&gt;
p117 第二段&lt;br /&gt;
the constant snare *of* fear of man&lt;br /&gt;
&lt;br /&gt;
Chapter 5&lt;br /&gt;
p124 第二段&lt;br /&gt;
the safety *of* my circumstances&lt;br /&gt;
p124 第三段&lt;br /&gt;
such a hatred of the savages [,-&amp;gt;] that I have been speaking of, and of the inhumane custom of their [and-&amp;gt;] eating one another up, &lt;br /&gt;
p125 第二段&lt;br /&gt;
[time-&amp;gt;] Time, however, &lt;br /&gt;
p125第三段&lt;br /&gt;
[things-&amp;gt;] Things going on thus&lt;br /&gt;
&lt;br /&gt;
P127 第二段&lt;br /&gt;
constantly kept my [Watch-&amp;gt;] watch; &lt;br /&gt;
p127 第三段&lt;br /&gt;
so my opinion of the action itself began to *alter*&lt;br /&gt;
p128 第二段&lt;br /&gt;
all possible means to *conceal* myself from them&lt;br /&gt;
p129 第四段&lt;br /&gt;
I [decided] resolved it all at last into thankfulness to that Providence *which* *had* delivered me from so many unseen dangers&lt;br /&gt;
p130 第一段&lt;br /&gt;
or *chop* a stick of wood&lt;br /&gt;
p130 第一段&lt;br /&gt;
at making any fire, [least-&amp;gt;] lest the smoke, which is visible at a great distance in the day, should *betray* me. &lt;br /&gt;
P131 第二段&lt;br /&gt;
Upon this, *plucking* up my courage, I took up a [great-&amp;gt;] firebrand, and I rushed in again, with the stick *flaming* in my hand;&lt;br /&gt;
p133 第二段&lt;br /&gt;
the walls *reflected* 100 thousand lights to me&lt;br /&gt;
p133 第三段&lt;br /&gt;
small [lose-&amp;gt;] loose gravel upon it&lt;br /&gt;
p134 第二段&lt;br /&gt;
I also carried there all the lead I had [belt-&amp;gt;] left for bullets. [lead 的意思：铅]&lt;br /&gt;
when I was come home [古旧英语] = when I had come home &lt;br /&gt;
p136 第一段&lt;br /&gt;
at a distance from me of about two miles, toward that [end-&amp;gt;] part of the island where I had&lt;br /&gt;
observed some savages had been, as before, [but-&amp;gt;] and not on the other side;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=English-novel-erratum-zhenghua&amp;diff=6229</id>
		<title>English-novel-erratum-zhenghua</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=English-novel-erratum-zhenghua&amp;diff=6229"/>
		<updated>2026-08-31T10:38:48Z</updated>

		<summary type="html">&lt;p&gt;Zhli：建立内容为“ == 床头灯英语 5000 词 鲁滨逊漂流记 全英文版 ==  其他 5000 词质量都没有这么差：吸血鬼、三十九级台阶、福尔摩斯、八十…”的新页面&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== 床头灯英语 5000 词 鲁滨逊漂流记 全英文版 ==&lt;br /&gt;
&lt;br /&gt;
其他 5000 词质量都没有这么差：吸血鬼、三十九级台阶、福尔摩斯、八十天环游地球&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Chapter 4&lt;br /&gt;
p113 第二段&lt;br /&gt;
[O-&amp;gt;] Oh, what *resolutions* men take when possessed with fear!”&lt;br /&gt;
we find anxiety greater*,* by much, than the evil&lt;br /&gt;
&lt;br /&gt;
p115 第一段&lt;br /&gt;
[least-&amp;gt;] lest they should not have the help of the tide&lt;br /&gt;
&lt;br /&gt;
p117 第二段&lt;br /&gt;
the constant snare *of* fear of man&lt;br /&gt;
&lt;br /&gt;
Chapter 5&lt;br /&gt;
p124 第二段&lt;br /&gt;
the safety *of* my circumstances&lt;br /&gt;
p124 第三段&lt;br /&gt;
such a hatred of the savages [,-&amp;gt;] that I have been speaking of, and of the inhumane custom of their [and-&amp;gt;] eating one another up, &lt;br /&gt;
p125 第二段&lt;br /&gt;
[time-&amp;gt;] Time, however, &lt;br /&gt;
p125第三段&lt;br /&gt;
[things-&amp;gt;] Things going on thus&lt;br /&gt;
&lt;br /&gt;
P127 第二段&lt;br /&gt;
constantly kept my [Watch-&amp;gt;] watch; &lt;br /&gt;
p127 第三段&lt;br /&gt;
so my opinion of the action itself began to *alter*&lt;br /&gt;
p128 第二段&lt;br /&gt;
all possible means to *conceal* myself from them&lt;br /&gt;
p129 第四段&lt;br /&gt;
I [decided] resolved it all at last into thankfulness to that Providence *which* *had* delivered me from so many unseen dangers&lt;br /&gt;
p130 第一段&lt;br /&gt;
or *chop* a stick of wood&lt;br /&gt;
p130 第一段&lt;br /&gt;
at making any fire, [least-&amp;gt;] lest the smoke, which is visible at a great distance in the day, should *betray* me. &lt;br /&gt;
P131 第二段&lt;br /&gt;
Upon this, *plucking* up my courage, I took up a [great-&amp;gt;] firebrand, and I rushed in again, with the stick *flaming* in my hand;&lt;br /&gt;
p133 第二段&lt;br /&gt;
the walls *reflected* 100 thousand lights to me&lt;br /&gt;
p133 第三段&lt;br /&gt;
small [lose-&amp;gt;] loose gravel upon it&lt;br /&gt;
p134 第二段&lt;br /&gt;
I also carried there all the lead I had [belt-&amp;gt;] left for bullets. [lead 的意思：铅]&lt;br /&gt;
when I was come home [古旧英语] = when I had come home &lt;br /&gt;
p136 第一段&lt;br /&gt;
at a distance from me of about two miles, toward that [end-&amp;gt;] part of the island where I had&lt;br /&gt;
observed some savages had been, as before, [but-&amp;gt;] and not on the other side;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6228</id>
		<title>Writing-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6228"/>
		<updated>2026-08-31T10:34:00Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;助教： 刘为杰 2024级博士研究生&lt;br /&gt;
&lt;br /&gt;
1）示范性读论文&lt;br /&gt;
&lt;br /&gt;
2）报告2-3 个（提问情况，作为平时成绩参考）&lt;br /&gt;
&lt;br /&gt;
3）翻转课堂（讨论公众号小文章）&lt;br /&gt;
&lt;br /&gt;
语析 LAGroup 微信公众号：写什么？论文写作点评、论文解读&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6227</id>
		<title>Writing-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2026-fall&amp;diff=6227"/>
		<updated>2026-08-24T06:45:46Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;1）示范性读论文&lt;br /&gt;
&lt;br /&gt;
2）报告2-3 个（提问情况，作为平时成绩参考）&lt;br /&gt;
&lt;br /&gt;
3）翻转课堂（讨论公众号小文章）&lt;br /&gt;
&lt;br /&gt;
语析 LAGroup 微信公众号：写什么？论文写作点评、论文解读&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Zhenghua-undergraduate-thesis&amp;diff=6226</id>
		<title>Zhenghua-undergraduate-thesis</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Zhenghua-undergraduate-thesis&amp;diff=6226"/>
		<updated>2026-07-16T01:48:49Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 2026 春 [2022级] */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 论文撰写注意事项 == &lt;br /&gt;
&lt;br /&gt;
[http://hlt.suda.edu.cn/index.php/Zhenghua-paper-writing 写论文的一些总结]&lt;br /&gt;
&lt;br /&gt;
= 毕业设计模板 =&lt;br /&gt;
注意：优先按照最新的规则；如果最新规则不涉及，而旧规则涉及到，就按旧规则。&lt;br /&gt;
&lt;br /&gt;
2022年5月本科毕业设计论文格式&lt;br /&gt;
*[[文件:论文排版及相关要求.zip]]&lt;br /&gt;
&lt;br /&gt;
2019年5月本科毕业设计论文格式&lt;br /&gt;
*[[文件:2018教务部毕业论文格式.zip]]&lt;br /&gt;
&lt;br /&gt;
2015年5月本科毕业设计论文格式（里面有样例论文，值得参考）&lt;br /&gt;
*[[文件:毕业设计要求与样例.zip]]&lt;br /&gt;
&lt;br /&gt;
= 毕业设计各个环节注意事项 =&lt;br /&gt;
&lt;br /&gt;
'''请大家参考之前优秀毕业设计的内容。比如2023年乔子恒同学的，里面有任务书、文献综述等，很全。'''&lt;br /&gt;
&lt;br /&gt;
== 中期检查前准备 ==&lt;br /&gt;
&lt;br /&gt;
=== 任务书 ===&lt;br /&gt;
&lt;br /&gt;
* 任务书认真撰写，老师审核&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
清晰、简洁&lt;br /&gt;
&lt;br /&gt;
主要内容部分：介绍要做的事情，讲清楚，让别人看懂。不是罗列论文每章的名字。&lt;br /&gt;
&lt;br /&gt;
基本要求，话要说完整，不要干巴巴写&lt;br /&gt;
&lt;br /&gt;
参考文献：格式要规范、统一（大小写、页码等）&lt;br /&gt;
参考文献的格式严格按照规范（将来论文中也要有，因此这个时候认真点，后面省事）&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== 文献翻译 ===&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
先根据毕设题目和简介，自己去找英文文献，找3-5个候选。然后发给老师，老师会确定待翻译的文章。进而翻译的word文档，&lt;br /&gt;
&lt;br /&gt;
尽量按照撰写正式论文的形式规范排版&lt;br /&gt;
** 论文标题&lt;br /&gt;
** 论文作者&lt;br /&gt;
** 论文出处（期刊[volumn/number]、会议、年份、页码等&lt;br /&gt;
** 正文部分：图、表、公式、参考文献一般不用翻译，直接截图，放在论文中即可（注意格式好一点）&lt;br /&gt;
** 比学校学院规定的字数多一些（例如多500）。如果论文过长，可以考虑只翻译一部分。&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== 文献综述 ===&lt;br /&gt;
* 在互联网上搜索相关文献：论文、网页、书籍等列表（5-10篇）&lt;br /&gt;
* 按照不同的类型，将论文梳理好，总结好（方法、数据、评价指标等）&lt;br /&gt;
&lt;br /&gt;
=== 2021级本科生毕业设计意向征集 ===&lt;br /&gt;
&lt;br /&gt;
李正华  &lt;br /&gt;
&lt;br /&gt;
2024.10.22&lt;br /&gt;
&lt;br /&gt;
为了做好毕业设计（双方都从容不迫），也避免将来在系统上抢题目（我可以指定同学），现面向2021级本科生发起毕业设计意向征集。'''截止到10月30日22:00。'''&lt;br /&gt;
&lt;br /&gt;
想跟我做毕业设计的同学，请发邮件联系我（zhli13@suda.edu.cn），介绍下基本情况、考研保研的情况或意向、学习或项目经历、希望做什么题目等。&lt;br /&gt;
&lt;br /&gt;
我们一起商量一个合适的题目，可以和你以前的学习或项目经历相结合（考研的同学时间紧，这一点比较重要）。&lt;br /&gt;
&lt;br /&gt;
我之前带过的大部分毕业设计，都在这个页面中，大家可以参考：http://hlt.suda.edu.cn/index.php/Zhenghua-undergraduate-thesis&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 老的信息，目前不感兴趣了：&lt;br /&gt;
噪音文本规范化&lt;br /&gt;
网上很多用户产生的数据，如产品的评论、客服等，会包含很多谐音字、缩写、错别字、语法错误、语义错误等，给自然语言理解造成巨大的挑战。项目的目标是通过检测和纠正错误和其他规范化处理，将噪音文本转化为规范文本。&lt;br /&gt;
&lt;br /&gt;
日志周志分析&lt;br /&gt;
把同学们的日志和周志拿下来&lt;br /&gt;
分析字数、关键词、图文比例 -&amp;gt;  研究生培养，研究生学习应该注意哪些&lt;br /&gt;
找错别字、病句&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 2027 春 [2023级] =&lt;br /&gt;
&lt;br /&gt;
== 基于多模态信息的网络有毒文本检测系统实现 ==&lt;br /&gt;
&lt;br /&gt;
闵文韬 2327405047 计科？&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
= 2026 春 [2022级] =&lt;br /&gt;
&lt;br /&gt;
== 全国城市空气质量序列预测系统实现 ==&lt;br /&gt;
&lt;br /&gt;
2227405025 计算机科学与技术 顾天宇&lt;br /&gt;
&lt;br /&gt;
== 基于大语言模型的数字人智能交互系统实现 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
2227405014 计算机科学与技术 段欣江&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
对话上下文模型、事件依赖关系、数字人角色特质。&lt;br /&gt;
利用语言模型的推理能力来优化数字人与用户之间的交互。&lt;br /&gt;
采用提示工程和微调等技术，融合语音、表情、动作等模态。&lt;br /&gt;
让数字人具有情感、个性，能流畅应答（长期、连贯、自然对话）。&lt;br /&gt;
应用场景：虚拟助手、数字客服、虚拟主播、在线教育。&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 2025 [2021级] =&lt;br /&gt;
&lt;br /&gt;
== 汉语成语内部结构分析方法研究与实现（胡志彬）==&lt;br /&gt;
&lt;br /&gt;
1929409021 胡志彬 计算机科学与技术&lt;br /&gt;
&lt;br /&gt;
训练一个模型，来做预测。比如“叶公好龙”属于主谓结构；“欢天喜地”属于并列结构。我们已经有一些训练数据和测试数据。&lt;br /&gt;
&lt;br /&gt;
== 文本拼写错误数据检测方法研究与实现（吕喆）==&lt;br /&gt;
&lt;br /&gt;
互联网上很多文本中都隐藏着很多拼写错误，比如“2022年第一次临死股东大会”。本毕业设计的目标是利用已有的一些工具，自动检测出拼写错误，进行少量的人工抽样检查，从而产生大量拼写错误数据。&lt;br /&gt;
&lt;br /&gt;
== PDF形式的学位论文格式检查系统设计与实现（杜佳峰） ==&lt;br /&gt;
&lt;br /&gt;
2127406082 杜佳峰 软件工程&lt;br /&gt;
&lt;br /&gt;
针对PDF文件，把每一页看成一个图片，与模板文件对比，找出不符合规范的部分。比如字体、行间距、对齐等。检查的项目，可以做得多，也可以做得少，比较灵活。会用到图片处理、OCR的一些技术。&lt;br /&gt;
&lt;br /&gt;
对PDF做格式检查，目前来看还没有成熟的工具来做（知网做不了）。这个毕业设计的核心是把PDF当成图片，用图像处理的方式来确定字体、字号、行间距等信息。和具体是哪个学校的模板没关系。给定一个模板，然后再给一个学生的论文，都是PDF格式，然后去做匹配、对比。&lt;br /&gt;
&lt;br /&gt;
= 2024 [2020级] =&lt;br /&gt;
&lt;br /&gt;
== 多音字拼音预测技术研究与实现 [20级人工智能阮菲菲] ==&lt;br /&gt;
&lt;br /&gt;
给定一个句子，把所有字的拼音给出来，主要工作是把数据准备好，然后用深度学习工具包来实现功能。&lt;br /&gt;
&lt;br /&gt;
[[File:2027_ruanfeifei.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 语音文本对齐数据挖掘技术研究与实现 [2020级人工智能李彦澍] ==&lt;br /&gt;
&lt;br /&gt;
从网络上爬取语音和文本对齐数据，并进行相关的后处理，从而得到比较干净的对齐数据，作为自动语音识别（ASR/STT）数据。&lt;br /&gt;
&lt;br /&gt;
[[File:2009_liyanshu.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 利用语音信息的文本分词技术研究与实现 [20级软件工程徐旻庥] ==&lt;br /&gt;
&lt;br /&gt;
分词任务的目标是将一个句子切分为一个一个词，这个毕业设计题目尝试额外利用语音信息帮助分词。&lt;br /&gt;
&lt;br /&gt;
[[File:2027_xuminxiu.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 多音字拼音数据挖掘技术研究与实现 [20级人工智能张丽群] ==&lt;br /&gt;
&lt;br /&gt;
从网络上爬取多音字拼音相关数据（文字、图片），并进行相关的后处理（清洗、格式化、图片OCR），从而得到比较干净的对齐数据。&lt;br /&gt;
&lt;br /&gt;
[[File:2027_zhangliqun.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 生物领域工具知识图谱构建技术研究与实现 [计科 侯羽飞] ==&lt;br /&gt;
&lt;br /&gt;
生物工具的命名实体识别项目，最终构建一个生物工具知识图谱&lt;br /&gt;
&lt;br /&gt;
知识图谱中的节点：tool name（algorithm/model/method）&lt;br /&gt;
&lt;br /&gt;
edge：tool之间的使用（调用）关系&lt;br /&gt;
&lt;br /&gt;
大量论文入手，作为原始数据，自动抽取tool name，自动构建edge&lt;br /&gt;
&lt;br /&gt;
该毕业设计的目标是从多源异构数据中发现生物工具，即tool name（如算法、模型、方法），并建立工具之间的使用（调用）关系，从而构成生物工具知识图谱。进而，将知识图谱作为大语言模型的知识增强手段，以辅助科研人员全面准确地索引生物工具信息，提升科研效率。&lt;br /&gt;
&lt;br /&gt;
= 2023 =&lt;br /&gt;
&lt;br /&gt;
== 外校保研王学彬：基于序列标注的文本顺滑方法 ==&lt;br /&gt;
王学彬 张磊mentor&lt;br /&gt;
   1）理解文本顺滑的背景和任务内涵，了解该任务的文本序列标注方法标签集情况。&lt;br /&gt;
   2）设计不同粒度的标签方案与当前主流方法采用的标签方案进行对比，探索不同标签方案对序列标注模型的影响；&lt;br /&gt;
   3）采用BERT-CRF模型对上述标签方案进行实验，得出的结论是细粒度标签方案比基线标签方案训练的模型性能更好。&lt;br /&gt;
&lt;br /&gt;
* [[:文件:王学彬-基于序列标注的文本顺滑方法（毕业论文）.pdf]]&lt;br /&gt;
* [[:文件:王学彬-基于序列标注的文本顺滑方法（答辩PPT）.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 面向科技文献领域的文本纠错系统实现 乔子恒 ==&lt;br /&gt;
&lt;br /&gt;
1927405039 计科 图灵班&lt;br /&gt;
&lt;br /&gt;
   1）使用爬虫技术爬取科技文献领域期刊论文，解析并提取正文。&lt;br /&gt;
   2）使用数据增强技术处理科技文献语料，实现通用纠错系统向科技文献领域的迁移。&lt;br /&gt;
   3）采用Flask+Vue+SQLite等前后端和数据库技术设计并实现一个文本纠错系统。&lt;br /&gt;
&lt;br /&gt;
蒋浩辰指导&lt;br /&gt;
&lt;br /&gt;
* [[文件:乔子恒-面向科技文献领域的文本纠错系统实现（毕业论文）.pdf]]&lt;br /&gt;
* [[文件:乔子恒-面向科技文献领域的文本纠错系统实现（答辩PPT）.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 领域词典约束的文本纠错技术研究与实现 张紫岩 == &lt;br /&gt;
&lt;br /&gt;
1928401062 计算机科学与技术（人工智能）&lt;br /&gt;
&lt;br /&gt;
指导者：周厚全&lt;br /&gt;
&lt;br /&gt;
   1）面向科技文献写作领域，构建数据集并进行了实验评测。&lt;br /&gt;
   2）构建领域词典，并提出了一种领域词典约束的数据增强方法。&lt;br /&gt;
   3）在构建的科技文献数据集上进行了数据增强实验，并提出了多维度的评测方法。&lt;br /&gt;
&lt;br /&gt;
* [[文件:张紫岩-领域词典约束的文本纠错技术研究与实现（毕业论文）.pdf]]&lt;br /&gt;
* [[文件:张紫岩-领域词典约束的文本纠错技术研究与实现（答辩PPT）.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 面向语音识别文本的纠错系统实现 张翔 ==&lt;br /&gt;
&lt;br /&gt;
1927405126 计科 图灵班&lt;br /&gt;
&lt;br /&gt;
张磊指导：&lt;br /&gt;
&lt;br /&gt;
   1）理解ASR纠错的背景和现状，对现今方法进行调研。&lt;br /&gt;
   2）利用Transformer+CTC模型对语音文本进行转换，同时采用2-fold方法对语音模型进行加强训练获得训练语料。&lt;br /&gt;
   3）采用GECTOR作为基础模型并在其基础上加上了拼音信息。得出结论拼音信息的引入对ASR纠错有着一定的影响。&lt;br /&gt;
&lt;br /&gt;
* [[文件:张翔-面向语音识别文本的纠错系统实现（毕业论文）.pdf]]&lt;br /&gt;
* [[文件:张翔-面向语音识别文本的纠错系统实现（答辩PPT）.pdf]]&lt;br /&gt;
&lt;br /&gt;
= 2022 =&lt;br /&gt;
&lt;br /&gt;
== 历年汇总 ==&lt;br /&gt;
* 2018级本科毕设(4)：周楚越、黄梓钧、辜仰淦（广东工业）、刘雨萌（江南) [2022春]&lt;br /&gt;
* 2017级本科毕设(6)：崔秀莲、窦晨晖、黄赛豪、司英杰、严福康、章岳 [2021春]&lt;br /&gt;
* 2016级本科毕设(7)：侯洋、黎霞、李帅克、周仕林、韩欣艳、杨奕、李嘉诚（燕山大学） [2020春]&lt;br /&gt;
* 2015级本科毕设(7)：陈婷、李烨秋、沈嘉钰、杨浩苹、袁源、周明月、周厚全（矿大）[2019春]&lt;br /&gt;
* 2014级本科毕设(3)：蒋炜、李丹、陆凯华 [2018春]&lt;br /&gt;
* 2013级本科毕设(5)：胡蝶、江心舟、孙文杰、严秋怡、章波 [2017春]&lt;br /&gt;
* 2012级本科毕设(2)：龚晨、夏庆荣 [2016春]&lt;br /&gt;
* 2011级本科毕设(4)：陆芳丽、穆景泉、王效静、张月 [2015春]&lt;br /&gt;
* 2010级本科毕设(1)：郁俊杰 [2014春]&lt;br /&gt;
&lt;br /&gt;
== 词典词义数据挖掘和融合系统实现 ==&lt;br /&gt;
&lt;br /&gt;
周楚越(1827405133)  严福康mentor&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1）从网络上挖掘尽可能多的词语词义及例句。&lt;br /&gt;
2）清洗数据，根据多方词典数据构建了一个词义尽可能全面的词典。&lt;br /&gt;
3）搭建了一个词语例句对应系统，用户输入词语，后续会有许多例句对应。&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1827405133-周楚越-词典词义数据挖掘和融合系统实现.pdf]]&lt;br /&gt;
* [[:文件:1827405133-周楚越-词典词义数据挖掘和融合系统实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 汉语词语内部结构标注和分析系统实现 == &lt;br /&gt;
&lt;br /&gt;
黄梓钧(1827405059)  龚晨mentor&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1）充分学习了预定义的具有11 个标签的词内部结构标注规范，在标注平台上人工标注了500 个词语的内部结构。&lt;br /&gt;
2）为了对汉语词语构词模式有更深入的理解，对标注结果进行了多方面的分析。&lt;br /&gt;
3）搭建了一个词内部结构分析系统，对于每一个输入的词语能够自动分析其内部结构，实现了词内部结构的可视化展示。&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1827405059-黄梓钧-汉语词语内部结构标注和分析系统实现.pdf]]&lt;br /&gt;
* [[:文件:1827405059-黄梓钧-汉语词语内部结构标注和分析系统实现ppt.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 外校保研辜仰淦：汉语多粒度词语内部依存结构分析研究与实现 ==&lt;br /&gt;
&lt;br /&gt;
龚晨mentor&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1）分析了多粒度词内部依存结构冲突的现象，给出了多粒度词内部依存结构分析的任务定义。同时基于词内部结构树库WIST以及多个命名实体数据集构建了两个多粒度词内部依存结构数据集。&lt;br /&gt;
2）根据多粒度词内部依存结构分析的任务定义，给出两个引入多粒度分析信息以解决冲突的解码算法：人工规则后处理（Rule-based）算法与基于Eisner-satta算法的约束解码（Constrained Eisner-satta）。&lt;br /&gt;
3）基于开源框架SuPar构建了面向多粒度词内部结构分析的Biaffine Parser和TreeCRF Parser，通过所构建的Parser模型进行实验，实验结果表明本文所提出的两个冲突解决方法能够有效提升词内部结构分析的效果。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:辜仰淦-汉语多粒度词语内部依存结构分析研究与实现-final.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 外校保研刘雨萌：text2sql ==&lt;br /&gt;
&lt;br /&gt;
grammar根据数据集简化，加速RATSQL&lt;br /&gt;
黄赛豪 mentor&lt;br /&gt;
&lt;br /&gt;
* [[:文件:刘雨萌-基于语法优化的快速Text-to-SQL语义解析研究.pdf]]&lt;br /&gt;
* [[:文件:刘雨萌-基于语法优化的快速Text-to-SQL语义解析研究(PPT).pdf]]&lt;br /&gt;
&lt;br /&gt;
= 2021 = &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 汉语词内部结构数据标注与模型实现 == &lt;br /&gt;
&lt;br /&gt;
黄赛豪 1727406002 软工&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1）基于CODT规范，做一些调整和简化，搞成一个新的、简化版的规范（~20页）&lt;br /&gt;
2）基于已有标注团队，标注1万高频词&lt;br /&gt;
3）分割为train/dev/test，然后基于biaffine parser，创建模型 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727406002-黄赛豪-汉语词内部结构数据标注与模型实现.pdf]]&lt;br /&gt;
* [[:文件:1727406002-黄赛豪-汉语词内部结构数据标注与模型实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 无监督句子级关键词抽取方法研究与实现 == &lt;br /&gt;
&lt;br /&gt;
窦晨晖 1727405032 计科&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1）深入学习tf-idf; textrank，实现出来&lt;br /&gt;
2）调用一些已有的工具（蒋炜已经实现的），了解输入输出和方法的主要思想&lt;br /&gt;
3）做实验对比 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727405032-窦晨晖-无监督句子级关键词抽取方法研究与实现.docx]]&lt;br /&gt;
* [[:文件:1727405032-窦晨晖-无监督句子级关键词抽取方法研究与实现.pdf]]&lt;br /&gt;
* [[:文件:1727405032-窦晨晖-无监督句子级关键词抽取方法研究与实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 词性数据标注错误检测方法研究与实现 == &lt;br /&gt;
&lt;br /&gt;
1727405137 崔秀莲 计科&lt;br /&gt;
  分词、词性数据都可以（优先考虑分词）&lt;br /&gt;
  找分词错误、不一致&lt;br /&gt;
  规则：各种统计分析，考虑上下文或者不考虑上下文&lt;br /&gt;
  模型：简化模型（参数少）、封闭测试（训练集和测试集一样）；多用几个模型，取交集；考虑概率信息&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727405137-崔秀莲-词性数据标注错误检测方法研究与实现.pdf]]&lt;br /&gt;
* [[:文件:1727405137-崔秀莲-词性数据标注错误检测方法研究与实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 基于序列编辑的语法纠错方法研究与实现 == &lt;br /&gt;
&lt;br /&gt;
1727406003 章岳&lt;br /&gt;
  借鉴开源代码，重现基本的seq2edit系统&lt;br /&gt;
  做一些创新：1）句法驱动；2）BPE；3）lattice encoder&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727406003-章岳-基于序列编辑的语法纠错方法研究与实现.docx]]&lt;br /&gt;
* [[:文件:1727406003-章岳-基于序列编辑的语法纠错方法研究与实现.pdf]]&lt;br /&gt;
* [[:文件:1727406003-章岳-基于序列编辑的语法纠错方法研究与实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 汉语缩略语规范化方法研究与实现 -&amp;gt; 汉语缩略语词典挖掘系统实现 ==&lt;br /&gt;
&lt;br /&gt;
严福康 1727405071 计科 &lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
专注缩略语词典挖掘，词典中每一项，由&amp;lt;缩略语，完整词&amp;gt;词对构成&lt;br /&gt;
方法1：从网上搜集（爬取或手动）&lt;br /&gt;
方法2：我上面提到的，给定大规模词典，如jieba的词库、搜狗词库。主要针对名词，通过字符串规则方式来抽取：如苏州大学 苏大&lt;br /&gt;
方法3：...&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
下面的是旧的&lt;br /&gt;
  1）搜集资源，缩略语（英文缩略、中文缩略、谐音）-&amp;gt; 规范表达，可能有1对多 &lt;br /&gt;
  重点做：中文拼音缩略语&lt;br /&gt;
  2）加语言模型验证，根据上下文确定最佳选择&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727405071-严福康-汉语缩略语词典挖掘系统实现.docx]]&lt;br /&gt;
* [[:文件:1727405071-严福康-汉语缩略语词典挖掘系统实现.pdf]]&lt;br /&gt;
* [[:文件:1727405071-严福康-汉语缩略语词典挖掘系统实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 基于ThinkPHP的数据标注系统实现 -&amp;gt; 基于SSM框架的数据标注系统实现 == &lt;br /&gt;
&lt;br /&gt;
司英杰 1727405072 计科&lt;br /&gt;
&lt;br /&gt;
我们有一个基于ThinkPHP老版本的系统，希望可以基于比较新的版本进行更新。后改为SSM框架。&lt;br /&gt;
&lt;br /&gt;
spring boot + springMVC + mybatis （java后端，前端是用的thymeleaf模板引擎+layui）&lt;br /&gt;
&lt;br /&gt;
* [[:文件:1727405072-司英杰-基于SSM框架的数据标注系统实现.docx]]&lt;br /&gt;
* [[:文件:1727405072-司英杰-基于SSM框架的数据标注系统实现.pdf]]&lt;br /&gt;
* [[:文件:1727405072-司英杰-基于SSM框架的数据标注系统实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
2021.4.10：一点感想：读我研究生的同学；如果特别熟悉的同学，也可以考虑。读研究生同学，比起找工作的同学，学习新东西的动力更足。&lt;br /&gt;
&lt;br /&gt;
= 2020 = &lt;br /&gt;
&lt;br /&gt;
== 词法数据标注和错误检测 == &lt;br /&gt;
&lt;br /&gt;
黎霞： 1627405116 计科&lt;br /&gt;
   分词、词性数据都可以（优先考虑分词）&lt;br /&gt;
   找分词错误、不一致&lt;br /&gt;
   句法错误检测（不一致等，用我们的数据或者PMT都可以）&lt;br /&gt;
   陈伟的工作：perl脚本&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627405116-黎霞-词法数据标注和错误检测.docx]]&lt;br /&gt;
*[[文件:1627405116-黎霞-词法数据标注和错误检测.pdf]]&lt;br /&gt;
*[[文件:1627405116-黎霞-词法数据标注和错误检测.pptx]]&lt;br /&gt;
*[[文件:1627405116-黎霞-词法数据标注和错误检测代码.zip]]&lt;br /&gt;
&lt;br /&gt;
== 句法数据查询和检索系统 ==&lt;br /&gt;
&lt;br /&gt;
杨奕： 1627405101 计科&lt;br /&gt;
   查询后结果可视化显式、反爬策略&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627405101-杨奕-句法数据查询和检索系统.docx]]&lt;br /&gt;
*[[文件:1627405101-杨奕-句法数据查询和检索系统.pdf]]&lt;br /&gt;
*[[文件:1627405101-杨奕-句法数据查询和检索系统.pptx]]&lt;br /&gt;
*[[文件:1627405101-杨奕-句法数据查询和检索系统代码.zip]]&lt;br /&gt;
&lt;br /&gt;
==  基于词典知识的分词领域移植 ==&lt;br /&gt;
&lt;br /&gt;
周仕林 1627405033 计科图灵&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
2020.2.11：&lt;br /&gt;
源领域数据：ctb5 &lt;br /&gt;
目标领域：ZX 和 car&lt;br /&gt;
词典的获取，和周厚全讨论&lt;br /&gt;
&lt;br /&gt;
参考论文：张梅山老师中文论文：词典特征&lt;br /&gt;
&lt;br /&gt;
----- &lt;br /&gt;
   传统模型或神经网络都可以，看进度&lt;br /&gt;
   二级词典，如果有时间试试远程监督&lt;br /&gt;
   在汽车领域数据上也做实验&lt;br /&gt;
&lt;br /&gt;
   分词上还可以做的事情：&lt;br /&gt;
   1）异构分词数据的利用方法比较&lt;br /&gt;
   2）jieba和nerual的结合： &lt;br /&gt;
   用pku数据得到词典，在pku上测试（不用HMM新词发现），和其他模型对比&lt;br /&gt;
   把jieba的结果作为额外信息，给neural模型使用&lt;br /&gt;
   深度学习和传统模型的结合：对于分词任务，jieba这种分词方法和深度学习模型的融合&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627405033-周仕林-基于词典知识的分词领域移植.docx]]&lt;br /&gt;
*[[文件:1627405033-周仕林-基于词典知识的分词领域移植.pdf]]&lt;br /&gt;
*[[文件:1627405033-周仕林-基于词典知识的分词领域移植.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 利用正确词法数据的依存句法分析 == &lt;br /&gt;
&lt;br /&gt;
李帅克 1627407014 物联网&lt;br /&gt;
   如何利用120w分词词性数据，提升PMT数据上的句法分析性能？&lt;br /&gt;
   进而，如何提高CTB数据的性能（异构词法）&lt;br /&gt;
   一个现实问题：句法分析时，如何加入词性词典（基于正确词性词典约束的句法分析）&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627407014-李帅克-利用正确词法数据的依存句法分析研究与实现.pdf]]&lt;br /&gt;
*[[文件:1627407014-李帅克-利用正确词法数据的依存句法分析研究与实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 基于局部标注的依存句法分析主动学习 == &lt;br /&gt;
&lt;br /&gt;
侯洋 1627406031 软工&lt;br /&gt;
    基于神经网络句法分析器biaffine parser&lt;br /&gt;
    local vs. crf-loss-first-order&lt;br /&gt;
    比较置信度的使用方式：边缘概率  local-softmax  边缘概率变种&lt;br /&gt;
&lt;br /&gt;
完整标注的情况下的实验也要做一下。&lt;br /&gt;
&lt;br /&gt;
local来确定置信度 crf来训练的曲线如何？&lt;br /&gt;
crf来产生置信度 Local来训练的曲线如何？&lt;br /&gt;
&lt;br /&gt;
别人帮你选要标注的词或句子（异构） vs. 自己选择&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627406031-侯洋-基于局部标注的依存句法分析主动学习研究与实现.docx]]&lt;br /&gt;
*[[文件:1627406031-侯洋-基于局部标注的依存句法分析主动学习研究与实现.pdf]]&lt;br /&gt;
*[[文件:1627406031-侯洋-基于局部标注的依存句法分析主动学习研究与实现.pptx]]&lt;br /&gt;
&lt;br /&gt;
== 基于知识库的上下位关系自动抽取 == &lt;br /&gt;
&lt;br /&gt;
韩欣艳 1627405044 计科图灵&lt;br /&gt;
    从OpenHowNet、同义词词林、Chinese WordNet中抽取上下位关系。&lt;br /&gt;
    进一步可以考虑翻译英文WordNet、澳门大学商务词典&lt;br /&gt;
    Shwartz	14,135	16,956	31,091&lt;br /&gt;
&lt;br /&gt;
  OpenHowNet:官网上有下载数据文件和项目文件。主要是通过义原的标注，找到描述词的核心词作为它的上位词（或者是较上层的描述词）。另外，可以对比词的相似性等等方法来抽取上位词。&lt;br /&gt;
  同义词词林：电子版同义词词林中没有上层结构的描述，通过纸质的书，或者查找其他文献看有没有归纳的方法。抽取的时候尽量抽取比较临近的词对。&lt;br /&gt;
  Chinese WordNet:结构类似于WordNet，看了一下有直接上下位描述，但是用的是英文表述，看一下相关资料有没有中文的表述。&lt;br /&gt;
&lt;br /&gt;
  OpenHowNet&lt;br /&gt;
  1.上下位关系词对主要研究名词词对，对HowNet的所有词语进行过滤，得到所有名词词性的词语。&lt;br /&gt;
  2.检索名词的义原，观察词语的义原树，作为上位词的义原所处层次不超过第二层。指定展开层数为2，获得词语的描述义原中核心描述词，作为潜在的上位词。【尝试比较层数的影响】&lt;br /&gt;
  3.检索名词的全部义原，利用相似度计算，计算词语与义原之间的相似度，词语间相似度最大值为1.0，根据观察，具有上下位关系的词对间相似度最低不小于0.70.，取不同的相似度区间，如[0.7,1]、[0.75,1]、[0.8,1]、[0.85,1]、[0.90,1]等，采取对比实验，在不同的相似度区间实现50个词语的上下位关系抽取，人工标注计算验证不同区间获得的准确率，最终选取准确率最高的区间进行抽取。【尝试比较词语相似度的影响】&lt;br /&gt;
  4.义原核心描述词也具有其自己的上位词，其上位词也可以作为名词词语的上位词。【检索展开层数为1时获取的核心词，是否还有上位词】&lt;br /&gt;
  5.直接获取HowNet中所有名词性义原的上位词，扩充上下位关系数据集&lt;br /&gt;
&lt;br /&gt;
  同义词词林&lt;br /&gt;
  1.词林中的大类词具有最强的概括性，可以作为上位词，其中第A至第D类大多为名词，可以进行上下位关系词对的抽取，第E大类为形容词，第F至第J大类是动词，第K大类为虚词，第L大类是难以分至其他类别的敬语，对这些类不作考虑。&lt;br /&gt;
  2.大类到中类和小类的抽取：对于中类词，若中类词是具有概括性的类别词，如“Bh 植物”，则将其纳入上下位关系抽取任务中，由此得到&amp;lt;中类词，大类词&amp;gt;，&amp;lt;小类词，中类词&amp;gt;上下位关系词对；若中类词是偏向描述性的属性词，如“Ac 体态”，则对中类词不作考虑，得到&amp;lt;小类词，大类词&amp;gt;词对。这一步需要手工选取，再进行自动抽取。&lt;br /&gt;
  3.小类到词群和词段的抽取：每个词群的第一个词是小类中的标题词，词群进一步向下细分成不同的词段，其中第一个词段的第一个词也是小类的标题词，抽取该标题词作为上位词，将词段中除标题词之外的词作为对应的下位词。【最后根据倒排可以利用词在百度百科出现频率数进行过滤】&lt;br /&gt;
&lt;br /&gt;
  Chinese WordNet&lt;br /&gt;
  1.网上找到的中文WordNet只有部分数据，先尝试在部分数据上做lmf文档解析，看从中能获取多少上下位词对。&lt;br /&gt;
  2.如果数量实在稀少，考虑进一步做网页爬取。&lt;br /&gt;
&lt;br /&gt;
*[[文件:1627405044-韩欣艳-基于知识库的上下位关系自动抽取.doc]]&lt;br /&gt;
*[[文件:1627405044-韩欣艳-基于知识库的上下位关系自动抽取.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 基于词典的汉语分词领域移植研究 == &lt;br /&gt;
秦友黄涛&lt;br /&gt;
  深入了解jieba分词的原理，然后重新实现（效率可以暂时不管，代码可读性要好）&lt;br /&gt;
  用我们手上的新闻语料，重新训练模型&lt;br /&gt;
  将Jieba用于分词领域移植问题，加入领域内词典和虚拟词频&lt;br /&gt;
  如果进展快，可以尝试把jieba和机器学习模型融合起来。&lt;br /&gt;
&lt;br /&gt;
== 基于神经网络的汉语分词领域移植研究与实现 == &lt;br /&gt;
李嘉诚&lt;br /&gt;
  基于BiLSTM-CRF&lt;br /&gt;
  参考：朱运2019中文论文、周厚全的毕业设计论文；了解任务、数据基本一样（还有一个汽车领域数据）&lt;br /&gt;
&lt;br /&gt;
= 2019 = &lt;br /&gt;
&lt;br /&gt;
== 自然语言句子分析平台实现 == &lt;br /&gt;
周明月&lt;br /&gt;
(1527403035)&lt;br /&gt;
&lt;br /&gt;
* 后台：实现分词（global linear model：黄德朋）、词性标注（global linear model）、依存句法分析（待定）&lt;br /&gt;
* 前端：javascript ajax【沿用蒋炜在多粒度分词上的代码，python】&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527403035-周明月-自然语言句子分析平台实现.pdf]]&lt;br /&gt;
*[[文件:1527403035-周明月-自言语言句子分析平台实现.zip]]&lt;br /&gt;
&lt;br /&gt;
== 汉语新词发现方法研究	== &lt;br /&gt;
李烨秋&lt;br /&gt;
(1527405091)	&lt;br /&gt;
&lt;br /&gt;
2019.3.29讨论&lt;br /&gt;
 调研，每个文章写一段话：问题定义、方法、评价数据和评价方法、结果如何&lt;br /&gt;
 先实现一种基于邻接熵，共现频率，互信息等（可以融合）的新词发现方法&lt;br /&gt;
 然后实现基于深度学习（word embedding）的方法（我推荐的那篇英文论文的方法）&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527405091-李烨秋-汉语新词发现方法研究.docx]]&lt;br /&gt;
*[[文件:1527405091-李烨秋-汉语新词发现方法研究.pdf]]&lt;br /&gt;
*[[文件:1527405091-李烨秋-汉语新词发现方法研究.pptx]]&lt;br /&gt;
*[[文件:1527405091-李烨秋-汉语新词发现方法研究.zip]]&lt;br /&gt;
&lt;br /&gt;
== 面向对话文本的浅层语义分析数据 ==&lt;br /&gt;
&lt;br /&gt;
杨浩苹&lt;br /&gt;
(1527405092)&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527405092-杨浩苹-面向对话文本的浅层语义分析数据标注和转化研究.pdf]]&lt;br /&gt;
*[[文件:1527405092-杨浩苹-面向对话文本的浅层语义分析数据标注和转化研究.pptx]]&lt;br /&gt;
*[[文件:1527405092-杨浩苹-面向对话文本的浅层语义分析数据标注和转化研究.zip]]&lt;br /&gt;
&lt;br /&gt;
== 网络文本错别字纠正数据标注系统 ==&lt;br /&gt;
&lt;br /&gt;
沈嘉钰&lt;br /&gt;
(1527407031)&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527407031-沈嘉钰-网络文本错别字纠正数据标注系统实现.docx]]&lt;br /&gt;
*[[文件:1527407031-沈嘉钰-网络文本错别字纠正数据标注系统实现.pdf]]&lt;br /&gt;
*[[文件:1527407031-沈嘉钰-网络文本错别字纠正数据标注系统实现.pptx]]&lt;br /&gt;
*[[文件:1527407031-沈嘉钰-网络文本错别字纠正数据标注系统实现.zip]]&lt;br /&gt;
&lt;br /&gt;
== 网络在线词典数据爬取系统 ==&lt;br /&gt;
陈婷&lt;br /&gt;
(1527405034)&lt;br /&gt;
&lt;br /&gt;
Mentor：朱运&lt;br /&gt;
&lt;br /&gt;
* 工作内容（2019.3.8）&lt;br /&gt;
** Python有开源的包，爬取网页，尽可能爬所有的词（如何能遍历电子词典中的所有词？）&lt;br /&gt;
** 网页正文提取（工具包可以用，自己写正则表达式，根据网页的规则去抽取）&lt;br /&gt;
** 归一化：制定一个比较完整的格式，字，词，拼音，词性，词义，例句，解释。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Christiane Fellbaum (1998, ed.) WordNet: An Electronic Lexical Database. Cambridge, MA: MIT Press. （前言）&lt;br /&gt;
&lt;br /&gt;
George A. Miller (1995). WordNet: A Lexical Database for English.&lt;br /&gt;
Communications of the ACM Vol. 38, No. 11: 39-41.&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527405034-陈婷-网络在线词典数据爬取系统.docx]]&lt;br /&gt;
*[[文件:1527405034-陈婷-网络在线词典数据爬取系统.pdf]]&lt;br /&gt;
*[[文件:1527405034-陈婷-网络在线词典数据爬取系统.pptx]]&lt;br /&gt;
*[[文件:1527405034-陈婷-网络在线词典数据爬取系统.zip]]&lt;br /&gt;
&lt;br /&gt;
== 汉语上下位关系词对抽取研究 == &lt;br /&gt;
&lt;br /&gt;
袁源&lt;br /&gt;
(1527405050)&lt;br /&gt;
&lt;br /&gt;
Mentor：陆凯华&lt;br /&gt;
&lt;br /&gt;
* 工作内容（2019.3.8）&lt;br /&gt;
** 定义：给定一大堆文本（文档），根据一些规则（模板），去抽取上下位词对（Hearst 1992?）&lt;br /&gt;
** bootstrapping：给一些种子上下位对，去找pttern，过滤掉差的模板，更多词对 -&amp;gt; 继续循环&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 1）搞清楚上下位关系的定义&lt;br /&gt;
 2）参考文献，设计一些Pattern，从wiki数据中自动抽取候选词对，进而人工标注，判定哪些是真正的上下位关系&lt;br /&gt;
 3）然后根据已有的上下位词对，在wiki数据上跑一遍，扩展pattern集合，人工check，哪些pattern是靠谱的&lt;br /&gt;
 4）回到步骤2&lt;br /&gt;
 5) 如果有时间，实现一个简答的基于特征的上下位关系分类方法，把pattern、后缀、共现频率等信息作为特征融合一下，放到一个分类模型（如最大熵）中。&lt;br /&gt;
&lt;br /&gt;
*[[文件:1527405050-袁源 汉语上下位关系词对抽取研究.pdf]]&lt;br /&gt;
*[[文件:1527405050-袁源 汉语上下位关系词对抽取研究.pptx]]&lt;br /&gt;
*[[文件:1527405050-袁源-汉语上下位关系词对抽取研究.zip]]&lt;br /&gt;
&lt;br /&gt;
== 基于深度学习的汉语分词领域移植 == &lt;br /&gt;
&lt;br /&gt;
周厚全&lt;br /&gt;
(08153445)&lt;br /&gt;
&lt;br /&gt;
*[[文件:08153445-周厚全-基于深度学习的汉语分词领域移植.docx]]&lt;br /&gt;
*[[文件:08153445-周厚全-基于深度学习的汉语分词领域移植.pdf]]&lt;br /&gt;
*[[文件:08153445-周厚全-基于深度学习的汉语分词领域移植.zip]]&lt;br /&gt;
&lt;br /&gt;
= 2018 =&lt;br /&gt;
== 基于内容的图像检索系统的设计与实现 ==&lt;br /&gt;
张宇&lt;br /&gt;
&lt;br /&gt;
*[[文件:基于内容的图像检索系统的设计与实现.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 多粒度分词演示系统 ==&lt;br /&gt;
蒋炜&lt;br /&gt;
&lt;br /&gt;
*[[文件:多粒度分词演示系统.docx]]&lt;br /&gt;
&lt;br /&gt;
== 跨平台跨浏览器数据标注界面设计与实现 ==&lt;br /&gt;
陆凯华&lt;br /&gt;
&lt;br /&gt;
*[http://hlt.suda.edu.cn/~zhli/papers/lu_kaihua_graduate_paper.docx 跨平台跨浏览器数据标注界面设计与实现.docx]&lt;br /&gt;
*[http://hlt.suda.edu.cn/~zhli/papers/lu_kaihua_graduate_paper.pdf 跨平台跨浏览器数据标注界面设计与实现.pdf]&lt;br /&gt;
&lt;br /&gt;
== AMR句子语义图显示与查询系统 ==&lt;br /&gt;
李丹&lt;br /&gt;
&lt;br /&gt;
*[[文件:AMR句子语义图显示与查询系统.docx]]&lt;br /&gt;
*[[文件:AMR句子语义图显示与查询系统.pdf]]&lt;br /&gt;
&lt;br /&gt;
= 2017 =&lt;br /&gt;
== 基于深度学习的多粒度分词方法研究 ==&lt;br /&gt;
江心舟&lt;br /&gt;
&lt;br /&gt;
*[[文件:基于深度学习的多粒度分词方法研究.pdf]]&lt;br /&gt;
*[[文件:基于深度学习的多粒度分词方法研究-jiangxinzhou.docx]]&lt;br /&gt;
&lt;br /&gt;
== 面向小微企业的高可调整性一体化管理系统——Android端研究与实现 ==&lt;br /&gt;
黄德朋&lt;br /&gt;
&lt;br /&gt;
*[[文件:面向小微企业的高可调整性一体化管理系统——Android端研究与实现.pdf]]&lt;br /&gt;
&lt;br /&gt;
= 2016 = &lt;br /&gt;
&lt;br /&gt;
== 中文问答系统中问题分类的研究与实现 == &lt;br /&gt;
龚晨&lt;br /&gt;
&lt;br /&gt;
*[[文件:中文问答系统中问题分类的研究与实现.pdf]]&lt;br /&gt;
*[[文件:中文问答系统中问题分类的研究与实现-gongchen.docx]]&lt;br /&gt;
&lt;br /&gt;
== 基于深度学习的序列标注问题研究 == &lt;br /&gt;
夏庆荣&lt;br /&gt;
*[[文件:基于深度学习的序列标注问题研究.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 分词标注平台设计与实现 == &lt;br /&gt;
王效静&lt;br /&gt;
*[http://hlt.suda.edu.cn/~zhli/papers/wang_xiaojing_graduate_paper.doc 分词标注平台设计与实现.doc]&lt;br /&gt;
&lt;br /&gt;
== 依存句法标注平台设计与实现 == &lt;br /&gt;
陆芳丽&lt;br /&gt;
*[http://hlt.suda.edu.cn/~zhli/papers/lu_fangli_graduate_paper.doc 依存句法标注平台设计与实现.doc（中间版本）]&lt;br /&gt;
* [[File:陆芳丽-面向依存句法分析的众包标注平台构建.doc]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6225</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6225"/>
		<updated>2026-07-13T11:48:05Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 计算成绩的规则和说明（待定） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（吕喆：周三晚上7点到9点，梅睿桐：周四晚上7点到9点）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
* 成绩计算&lt;br /&gt;
** 四次随堂考试，折算为9次实验成绩，然后加权得到总体成绩&lt;br /&gt;
** 9 次实验报告，做形式检查，每个报告给-10 到 10 分，最后加权算出一个总体的“加减分值”，影响总体成绩【大部分同学都是 0 附近的数值】&lt;br /&gt;
** 如果某位同学要求复核成绩，除非有大的纰漏，否则我会以更严格的方式来批阅，会导致降分。&lt;br /&gt;
** 同学要求复核的话，请联系助教。反馈的截止时间：7 月 14日 12:00&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 以.zip压缩包形式提交，需包含以下内容&lt;br /&gt;
** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 压缩包（姓名学号.zip）&lt;br /&gt;
*** 实验报告（姓名学号.pdf）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况。感谢曹诗伟同学指出错误。】&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 6 周下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 10 周下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 12 周之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
$$\textit{tf}_{t,d}$$&lt;br /&gt;
$$\textit{df}_{t}$$&lt;br /&gt;
$$\textit{idf}_{t} = \log_{10}{\frac{N}{\textit{df}_t}}$$&lt;br /&gt;
\[&lt;br /&gt;
\textit{w}_{t,d} = &lt;br /&gt;
\begin{cases}&lt;br /&gt;
1+\log_{10}{\textit{tf}_{t,d}}, &amp;amp; \text{if } \textit{tf}_{t,d} &amp;gt; 0 \\&lt;br /&gt;
0, &amp;amp; \text{elsewise}&lt;br /&gt;
\end{cases}&lt;br /&gt;
\]&lt;br /&gt;
 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第14 周下课之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
* 作业提交时间截止时间：第16 周下课之前提交&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=New-stu-training&amp;diff=6224</id>
		<title>New-stu-training</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=New-stu-training&amp;diff=6224"/>
		<updated>2026-06-19T02:11:26Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 分字 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 李正华TODO ==&lt;br /&gt;
  我的PPT不好，有的要简化，例如GB编码没有具体说明：两个字节，第一个字节怎么样。&lt;br /&gt;
  有的需要更详细、更丰满。&lt;br /&gt;
&lt;br /&gt;
== 说明 ==&lt;br /&gt;
&lt;br /&gt;
* 所有俱乐部同学，包括刚进入实验室的研究生，都要做NLP基础编程练习，一方面提高编程能力，另一方面打好机器学习和自然语言处理的基础&lt;br /&gt;
* 我们精心设计了一系列的基础练习作业，从简单到复杂，逐步深入：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/ 题目（课程）主页]&lt;br /&gt;
* 请直入主题，从题目出发，按照推荐的顺序，逐一做&lt;br /&gt;
* 遇到一个题目，去下面的课件或讲义中寻找相关内容，进行快速学习和理解&lt;br /&gt;
** 做基础练习的时候，要关注主要知识点，不要陷入细枝末节，否则的话，进度就太慢了。比如随机过程，这个本身是非常大的一个概念，千万不要钻进去学习，了解其基本概念、例子即可。&lt;br /&gt;
** 以正确完成编程题目为主要目标。我相信，等编程作业做完了，很多知识点就会有自己的理解了&lt;br /&gt;
** '''做事情的三步：&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;做出来、做对、做好&amp;lt;/font&amp;gt;'''&lt;br /&gt;
* 注意，&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;千万不要直接看别人写好的代码，一定要努力自己去理解和消化。&amp;lt;/font&amp;gt;一定要有一个自己思考的过程，尽最大努力自己写代码，即使效率低，准确率差，也没关系。通过自己的思考，逐渐优化和提高。这个过程非常重要，很有意义。&lt;br /&gt;
* 另外，&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;尽量不要在网上找各种参考资料。&amp;lt;/font&amp;gt;虽然我的讲义很精简，但是如果仔细看，认真思考，推导，一定能搞明白。这个过程也很重要，对自我提升很有帮助。&lt;br /&gt;
** 任何一个理论或方法，从不同角度都可以进行解释，看的角度多了，就没有自己的角度了。网上的各种资料，都是从不同角度来说同一个事，看多了就乱了。&lt;br /&gt;
* 如果有问题，可以找自己的mentor去讨论，如果mentor也不懂，那说明mentor也没理解，就可以发邮件给老师。&lt;br /&gt;
&lt;br /&gt;
== 参考书目 ==&lt;br /&gt;
* Dan Jurafsky. [https://web.stanford.edu/%7Ejurafsky/slp3/ Speech and Language Processing][https://www.kancloud.cn/drxgz/slp20201230#/dashboard 中文翻译] (强烈推荐！)&lt;br /&gt;
* [http://neuralnetworksanddeeplearning.com/ Neural networks and deep learning]（李正华强烈推荐，看完前三章就差不多了）&lt;br /&gt;
* Andrew Ng的视频:[https://mooc.study.163.com/university/deeplearning_ai#/c 吴恩达深度学习(带中文字幕)]&lt;br /&gt;
* Chris Manning. 2005. 统计自然语言处理基础.&lt;br /&gt;
* 宗成庆. 2008. 统计自然语言处理.&lt;br /&gt;
* 李航. 2012. 统计学习方法.&lt;br /&gt;
* 神经网络与深度学习&lt;br /&gt;
...&lt;br /&gt;
&lt;br /&gt;
=== 神经网络公开课第十三章：面向自然语言处理的神经网络 （苏州大学 李正华）=== &lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.1.mp4 第1节：从离散特征到连续稠密向量表示]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.2.mp4 第2节：表示学习]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.3.mp4 第3节：序列标注问题]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.4.mp4 第4节：句法树解析问题]&lt;br /&gt;
&lt;br /&gt;
== 数据（utf8编码） ==&lt;br /&gt;
&lt;br /&gt;
=== CoNLL格式的含义 ===&lt;br /&gt;
* 每个词占一行，每行的第2列为当前词语，第4列为当前词的词性，第7列为当前词的中心词的序号，第8列为当前词语与中心词的依存关系。句子与句子之间以空行间隔。&lt;br /&gt;
&lt;br /&gt;
=== 最大匹配分词数据 ===&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/5-chinese-word-segmentation/data.conll 分词数据]&lt;br /&gt;
&lt;br /&gt;
=== 词性标注数据 === &lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/6-ngram-language-model/data.tar.gz 小数据集]&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 训练&lt;br /&gt;
! 开发&lt;br /&gt;
|-&lt;br /&gt;
| 803句&lt;br /&gt;
| 1910句&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/ctb5-postagged.tar.gz 大数据集]&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 训练&lt;br /&gt;
! 开发&lt;br /&gt;
! 测试&lt;br /&gt;
|-&lt;br /&gt;
| 16091句&lt;br /&gt;
| 803句&lt;br /&gt;
| 1910句&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
* 示例： 输入：严守一 把 手机 关 了        输出：严守一/NR 把/P手机/NN关/VV 了/SP&lt;br /&gt;
&lt;br /&gt;
== 基础编程训练列表 ==&lt;br /&gt;
&lt;br /&gt;
=== 分字 ===&lt;br /&gt;
&lt;br /&gt;
* 2022春IR课程视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
&lt;br /&gt;
【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况】&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 下面的内容可以不看&lt;br /&gt;
** 给定文件，将文件中的句子按照字（字符）切分，字符中间用空格隔开。用C/C++实现。Python（3.0）可以直接用split处理UTF8编码的字符串，也试试，对比一下结果。&lt;br /&gt;
** 参考资料：[[File:Chinese-encoding.pdf]]&lt;br /&gt;
** 数据：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/2-chinese-encoding/example.tar.gz 几个不同编码的文件]，可以用hexdump查看。也可以自己生成不同编码的文件。&lt;br /&gt;
&lt;br /&gt;
=== 最大匹配分词 ===&lt;br /&gt;
&lt;br /&gt;
* 2022春IR课程视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
* 下面的内容可以不看&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/5-chinese-word-segmentation/max-match.ppt 最大匹配]&lt;br /&gt;
&lt;br /&gt;
=== 有监督HMM词性标注 ===&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4.mp4 第4部分]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1-hd.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2-hd.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3-hd.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4-hd.mp4 第4部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2.jpg 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3.jpg 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4.jpg 第4部分]&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/collins-tagging.pdf Collins教授课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/main.pdf 李正华的课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/HMM-v2.pptx 理解HMM的Viterbi]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging-MLE/main.pdf HMM模型中极大似然估计的由来(公式推导)]&lt;br /&gt;
&lt;br /&gt;
=== 基于线性模型（linear model）的词性标注 ===&lt;br /&gt;
* 要点：判别模型、partial feature&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/9-linear-model/main2.pdf 李正华老师课件]&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-2.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-3.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-4.mp4 第4部分]、[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-5.mp4 第5部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-2.jpg 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-3.jpg 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-4.jpg 第4部分]、[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-5.jpg 第5部分]&lt;br /&gt;
&lt;br /&gt;
=== 基于最大熵（max-entropy，log-linear）模型的词性标注 === &lt;br /&gt;
* 要点：梯度下降方法，Adam优化&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/10-maxent-loglinear/main.pdf 李正华老师课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/10-maxent-loglinear/collins-loglinear.pdf Collins教授课件]&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-2.mp4 第2部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-2.jpg 第2部分]&lt;br /&gt;
&lt;br /&gt;
=== 基于全局线性模型（global linear model）的词性标注 ===&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/11-global-linear-model/main.pdf 李正华老师课件]&lt;br /&gt;
&lt;br /&gt;
=== 基于条件随机场（conditional random field，CRF）模型的词性标注 ===&lt;br /&gt;
* 要点：全局概率、期望、Forward-backward结合、viterbi解码&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/12-crf/main.pdf 李正华老师课件]&lt;br /&gt;
&lt;br /&gt;
=== 基于前馈神经网络（FFN）的词性标注 === &lt;br /&gt;
* 要点：必须自己实现前向计算loss，和backpropagation。&lt;br /&gt;
* 参考：neural networks and deeplearning神经网络入门书籍 基本阅读完前三章即可完成本任务. [https://mooc.study.163.com/university/deeplearning_ai#/c 吴恩达深度学习(带中文字幕)]&lt;br /&gt;
&lt;br /&gt;
=== 基于FFN-CRF的词性标注 ===&lt;br /&gt;
* 要点：仍然自己实现前向计算loss，和backpropagation。&lt;br /&gt;
* 提示：将神经网络输出看成发射矩阵，之后加上转移矩阵&lt;br /&gt;
&lt;br /&gt;
=== 基于BiLSTM的词性标注 ===&lt;br /&gt;
* 要点：可以利用Pytorch自带的。Dropout等的使用，是关键。&lt;br /&gt;
&lt;br /&gt;
=== 基于BiLSTM-CRF的词性标注 ===&lt;br /&gt;
&lt;br /&gt;
=== github已有代码，不同同学的代码可以看不同的branch： ===&lt;br /&gt;
&lt;br /&gt;
[https://github.com/SUDA-LA/CIP github网址]&lt;br /&gt;
&lt;br /&gt;
== 后续自主学习扩展 ==&lt;br /&gt;
&lt;br /&gt;
=== 基于图的依存句法分析 ===&lt;br /&gt;
&lt;br /&gt;
直接用神经网络实现即可。Biaffine Parser框架。&lt;br /&gt;
&lt;br /&gt;
重点：Eisner动态规划解码算法（看我的COLING-2014 tutorial）&lt;br /&gt;
&lt;br /&gt;
进而可以扩展到TreeCRF，将Eisner算法扩展为inside算法。&lt;br /&gt;
&lt;br /&gt;
具体看我们的ACL-2020文章：Yu Zhang et al.&lt;br /&gt;
&lt;br /&gt;
=== 基于转移的依存句法分析 ===&lt;br /&gt;
&lt;br /&gt;
了解一下转移系统&lt;br /&gt;
&lt;br /&gt;
=== Seq2Seq (RNN) NMT with attention ===&lt;br /&gt;
&lt;br /&gt;
了解一下语言生成&lt;br /&gt;
&lt;br /&gt;
=== Transformer NMT ===&lt;br /&gt;
&lt;br /&gt;
这里面的技术细节很多。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 无监督学习 ===&lt;br /&gt;
&lt;br /&gt;
HMM-EM&lt;br /&gt;
&lt;br /&gt;
VAE&lt;br /&gt;
&lt;br /&gt;
=== ELMo/BERT的原理 ===&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=New-stu-training&amp;diff=6223</id>
		<title>New-stu-training</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=New-stu-training&amp;diff=6223"/>
		<updated>2026-06-19T02:11:08Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 基础编程训练列表 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 李正华TODO ==&lt;br /&gt;
  我的PPT不好，有的要简化，例如GB编码没有具体说明：两个字节，第一个字节怎么样。&lt;br /&gt;
  有的需要更详细、更丰满。&lt;br /&gt;
&lt;br /&gt;
== 说明 ==&lt;br /&gt;
&lt;br /&gt;
* 所有俱乐部同学，包括刚进入实验室的研究生，都要做NLP基础编程练习，一方面提高编程能力，另一方面打好机器学习和自然语言处理的基础&lt;br /&gt;
* 我们精心设计了一系列的基础练习作业，从简单到复杂，逐步深入：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/ 题目（课程）主页]&lt;br /&gt;
* 请直入主题，从题目出发，按照推荐的顺序，逐一做&lt;br /&gt;
* 遇到一个题目，去下面的课件或讲义中寻找相关内容，进行快速学习和理解&lt;br /&gt;
** 做基础练习的时候，要关注主要知识点，不要陷入细枝末节，否则的话，进度就太慢了。比如随机过程，这个本身是非常大的一个概念，千万不要钻进去学习，了解其基本概念、例子即可。&lt;br /&gt;
** 以正确完成编程题目为主要目标。我相信，等编程作业做完了，很多知识点就会有自己的理解了&lt;br /&gt;
** '''做事情的三步：&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;做出来、做对、做好&amp;lt;/font&amp;gt;'''&lt;br /&gt;
* 注意，&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;千万不要直接看别人写好的代码，一定要努力自己去理解和消化。&amp;lt;/font&amp;gt;一定要有一个自己思考的过程，尽最大努力自己写代码，即使效率低，准确率差，也没关系。通过自己的思考，逐渐优化和提高。这个过程非常重要，很有意义。&lt;br /&gt;
* 另外，&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;尽量不要在网上找各种参考资料。&amp;lt;/font&amp;gt;虽然我的讲义很精简，但是如果仔细看，认真思考，推导，一定能搞明白。这个过程也很重要，对自我提升很有帮助。&lt;br /&gt;
** 任何一个理论或方法，从不同角度都可以进行解释，看的角度多了，就没有自己的角度了。网上的各种资料，都是从不同角度来说同一个事，看多了就乱了。&lt;br /&gt;
* 如果有问题，可以找自己的mentor去讨论，如果mentor也不懂，那说明mentor也没理解，就可以发邮件给老师。&lt;br /&gt;
&lt;br /&gt;
== 参考书目 ==&lt;br /&gt;
* Dan Jurafsky. [https://web.stanford.edu/%7Ejurafsky/slp3/ Speech and Language Processing][https://www.kancloud.cn/drxgz/slp20201230#/dashboard 中文翻译] (强烈推荐！)&lt;br /&gt;
* [http://neuralnetworksanddeeplearning.com/ Neural networks and deep learning]（李正华强烈推荐，看完前三章就差不多了）&lt;br /&gt;
* Andrew Ng的视频:[https://mooc.study.163.com/university/deeplearning_ai#/c 吴恩达深度学习(带中文字幕)]&lt;br /&gt;
* Chris Manning. 2005. 统计自然语言处理基础.&lt;br /&gt;
* 宗成庆. 2008. 统计自然语言处理.&lt;br /&gt;
* 李航. 2012. 统计学习方法.&lt;br /&gt;
* 神经网络与深度学习&lt;br /&gt;
...&lt;br /&gt;
&lt;br /&gt;
=== 神经网络公开课第十三章：面向自然语言处理的神经网络 （苏州大学 李正华）=== &lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.1.mp4 第1节：从离散特征到连续稠密向量表示]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.2.mp4 第2节：表示学习]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.3.mp4 第3节：序列标注问题]&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.4.mp4 第4节：句法树解析问题]&lt;br /&gt;
&lt;br /&gt;
== 数据（utf8编码） ==&lt;br /&gt;
&lt;br /&gt;
=== CoNLL格式的含义 ===&lt;br /&gt;
* 每个词占一行，每行的第2列为当前词语，第4列为当前词的词性，第7列为当前词的中心词的序号，第8列为当前词语与中心词的依存关系。句子与句子之间以空行间隔。&lt;br /&gt;
&lt;br /&gt;
=== 最大匹配分词数据 ===&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/5-chinese-word-segmentation/data.conll 分词数据]&lt;br /&gt;
&lt;br /&gt;
=== 词性标注数据 === &lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/6-ngram-language-model/data.tar.gz 小数据集]&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 训练&lt;br /&gt;
! 开发&lt;br /&gt;
|-&lt;br /&gt;
| 803句&lt;br /&gt;
| 1910句&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/ctb5-postagged.tar.gz 大数据集]&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 训练&lt;br /&gt;
! 开发&lt;br /&gt;
! 测试&lt;br /&gt;
|-&lt;br /&gt;
| 16091句&lt;br /&gt;
| 803句&lt;br /&gt;
| 1910句&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
* 示例： 输入：严守一 把 手机 关 了        输出：严守一/NR 把/P手机/NN关/VV 了/SP&lt;br /&gt;
&lt;br /&gt;
== 基础编程训练列表 ==&lt;br /&gt;
&lt;br /&gt;
=== 分字 ===&lt;br /&gt;
&lt;br /&gt;
* 2022春IR课程视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况。】&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 下面的内容可以不看&lt;br /&gt;
** 给定文件，将文件中的句子按照字（字符）切分，字符中间用空格隔开。用C/C++实现。Python（3.0）可以直接用split处理UTF8编码的字符串，也试试，对比一下结果。&lt;br /&gt;
** 参考资料：[[File:Chinese-encoding.pdf]]&lt;br /&gt;
** 数据：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/2-chinese-encoding/example.tar.gz 几个不同编码的文件]，可以用hexdump查看。也可以自己生成不同编码的文件。&lt;br /&gt;
&lt;br /&gt;
=== 最大匹配分词 ===&lt;br /&gt;
&lt;br /&gt;
* 2022春IR课程视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
* 下面的内容可以不看&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/5-chinese-word-segmentation/max-match.ppt 最大匹配]&lt;br /&gt;
&lt;br /&gt;
=== 有监督HMM词性标注 ===&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4.mp4 第4部分]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1-hd.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2-hd.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3-hd.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4-hd.mp4 第4部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-2.jpg 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-3.jpg 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/HMM-part-4.jpg 第4部分]&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/collins-tagging.pdf Collins教授课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/main.pdf 李正华的课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging/HMM-v2.pptx 理解HMM的Viterbi]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/7-hmm-tagging-MLE/main.pdf HMM模型中极大似然估计的由来(公式推导)]&lt;br /&gt;
&lt;br /&gt;
=== 基于线性模型（linear model）的词性标注 ===&lt;br /&gt;
* 要点：判别模型、partial feature&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/9-linear-model/main2.pdf 李正华老师课件]&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-2.mp4 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-3.mp4 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-4.mp4 第4部分]、[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-5.mp4 第5部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-2.jpg 第2部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-3.jpg 第3部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-4.jpg 第4部分]、[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/linear-model-5.jpg 第5部分]&lt;br /&gt;
&lt;br /&gt;
=== 基于最大熵（max-entropy，log-linear）模型的词性标注 === &lt;br /&gt;
* 要点：梯度下降方法，Adam优化&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/10-maxent-loglinear/main.pdf 李正华老师课件]、[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/10-maxent-loglinear/collins-loglinear.pdf Collins教授课件]&lt;br /&gt;
* 图片和视频：&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-1.mp4 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-2.mp4 第2部分]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-1.jpg 第1部分]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/HMM/Maximum-entropy-2.jpg 第2部分]&lt;br /&gt;
&lt;br /&gt;
=== 基于全局线性模型（global linear model）的词性标注 ===&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/11-global-linear-model/main.pdf 李正华老师课件]&lt;br /&gt;
&lt;br /&gt;
=== 基于条件随机场（conditional random field，CRF）模型的词性标注 ===&lt;br /&gt;
* 要点：全局概率、期望、Forward-backward结合、viterbi解码&lt;br /&gt;
* 参考课件：[http://hlt.suda.edu.cn/~zhli/teach/cip-2015-fall/12-crf/main.pdf 李正华老师课件]&lt;br /&gt;
&lt;br /&gt;
=== 基于前馈神经网络（FFN）的词性标注 === &lt;br /&gt;
* 要点：必须自己实现前向计算loss，和backpropagation。&lt;br /&gt;
* 参考：neural networks and deeplearning神经网络入门书籍 基本阅读完前三章即可完成本任务. [https://mooc.study.163.com/university/deeplearning_ai#/c 吴恩达深度学习(带中文字幕)]&lt;br /&gt;
&lt;br /&gt;
=== 基于FFN-CRF的词性标注 ===&lt;br /&gt;
* 要点：仍然自己实现前向计算loss，和backpropagation。&lt;br /&gt;
* 提示：将神经网络输出看成发射矩阵，之后加上转移矩阵&lt;br /&gt;
&lt;br /&gt;
=== 基于BiLSTM的词性标注 ===&lt;br /&gt;
* 要点：可以利用Pytorch自带的。Dropout等的使用，是关键。&lt;br /&gt;
&lt;br /&gt;
=== 基于BiLSTM-CRF的词性标注 ===&lt;br /&gt;
&lt;br /&gt;
=== github已有代码，不同同学的代码可以看不同的branch： ===&lt;br /&gt;
&lt;br /&gt;
[https://github.com/SUDA-LA/CIP github网址]&lt;br /&gt;
&lt;br /&gt;
== 后续自主学习扩展 ==&lt;br /&gt;
&lt;br /&gt;
=== 基于图的依存句法分析 ===&lt;br /&gt;
&lt;br /&gt;
直接用神经网络实现即可。Biaffine Parser框架。&lt;br /&gt;
&lt;br /&gt;
重点：Eisner动态规划解码算法（看我的COLING-2014 tutorial）&lt;br /&gt;
&lt;br /&gt;
进而可以扩展到TreeCRF，将Eisner算法扩展为inside算法。&lt;br /&gt;
&lt;br /&gt;
具体看我们的ACL-2020文章：Yu Zhang et al.&lt;br /&gt;
&lt;br /&gt;
=== 基于转移的依存句法分析 ===&lt;br /&gt;
&lt;br /&gt;
了解一下转移系统&lt;br /&gt;
&lt;br /&gt;
=== Seq2Seq (RNN) NMT with attention ===&lt;br /&gt;
&lt;br /&gt;
了解一下语言生成&lt;br /&gt;
&lt;br /&gt;
=== Transformer NMT ===&lt;br /&gt;
&lt;br /&gt;
这里面的技术细节很多。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 无监督学习 ===&lt;br /&gt;
&lt;br /&gt;
HMM-EM&lt;br /&gt;
&lt;br /&gt;
VAE&lt;br /&gt;
&lt;br /&gt;
=== ELMo/BERT的原理 ===&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6222</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6222"/>
		<updated>2026-06-17T23:06:05Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（吕喆：周三晚上7点到9点，梅睿桐：周四晚上7点到9点）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 以.zip压缩包形式提交，需包含以下内容&lt;br /&gt;
** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 压缩包（姓名学号.zip）&lt;br /&gt;
*** 实验报告（姓名学号.pdf）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况。感谢曹诗伟同学指出错误。】&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 6 周下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 10 周下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 12 周之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
$$\textit{tf}_{t,d}$$&lt;br /&gt;
$$\textit{df}_{t}$$&lt;br /&gt;
$$\textit{idf}_{t} = \log_{10}{\frac{N}{\textit{df}_t}}$$&lt;br /&gt;
\[&lt;br /&gt;
\textit{w}_{t,d} = &lt;br /&gt;
\begin{cases}&lt;br /&gt;
1+\log_{10}{\textit{tf}_{t,d}}, &amp;amp; \text{if } \textit{tf}_{t,d} &amp;gt; 0 \\&lt;br /&gt;
0, &amp;amp; \text{elsewise}&lt;br /&gt;
\end{cases}&lt;br /&gt;
\]&lt;br /&gt;
 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第14 周下课之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
* 作业提交时间截止时间：第16 周下课之前提交&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6221</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6221"/>
		<updated>2026-06-17T23:05:33Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（吕喆：周三晚上7点到9点，梅睿桐：周四晚上7点到9点）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 以.zip压缩包形式提交，需包含以下内容&lt;br /&gt;
** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 压缩包（姓名学号.zip）&lt;br /&gt;
*** 实验报告（姓名学号.pdf）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况。感谢曹诗伟同学指出错误。】&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 6 周下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 10 周下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 12 周之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
$$\textit{tf}_{t,d}$$&lt;br /&gt;
$$\textit{df}_{t}$$&lt;br /&gt;
$$\textit{idf}_{t} = \log_{10}{\frac{N}{\textit{df}_t}}$$&lt;br /&gt;
\[&lt;br /&gt;
\textit{w}_{t,d} = &lt;br /&gt;
\begin{cases}&lt;br /&gt;
1+\log_{10}{\textit{tf}_{t,d}}, &amp;amp; \text{if } \textit{tf}_{t,d} &amp;gt; 0 \\&lt;br /&gt;
0, &amp;amp; \text{elsewise}&lt;br /&gt;
\end{cases}&lt;br /&gt;
\]&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第14 周下课之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
* 作业提交时间截止时间：第16 周下课之前提交&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6220</id>
		<title>What-i-believe-Einstein</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6220"/>
		<updated>2026-06-02T03:10:00Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;* 以下是爱因斯坦 '''《我的信仰》（What I Believe）''' 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（''Forum and Century''）杂志第84卷。&lt;br /&gt;
&lt;br /&gt;
== What I Believe ==&lt;br /&gt;
* By Albert Einstein&lt;br /&gt;
&lt;br /&gt;
How strange is the lot of us mortals! Each of us is here for a brief sojourn; for what purpose he knows not, though he sometimes thinks he senses it. But without deeper reflection one knows from daily life that one exists for other people—first of all for those upon whose smiles and well-being our own happiness is wholly dependent, and then for the many, unknown to us, to whose destinies we are bound by the ties of sympathy. A hundred times every day I remind myself that my inner and outer life are based on the labors of other men, living and dead, and that I must exert myself in order to give in the same measure as I have received and am still receiving. I am strongly drawn to a frugal life and am often oppressively aware that I am engrossing an undue amount of the labor of my fellow-men. I regard class distinctions as unjustified and, in the last resort, based on force. I also believe that a simple and unassuming life is good for everybody, physically and mentally.&lt;br /&gt;
&lt;br /&gt;
I do not at all believe in human freedom in the philosophical sense. Everybody acts not only under external compulsion but also in accordance with inner necessity. Schopenhauer's saying, &amp;quot;A man can do what he wants, but not want what he wants,&amp;quot; has been a very real inspiration to me since my youth; it has been a continual consolation in the face of life's hardships, my own and others', and an unfailing well-spring of tolerance. This realization mercifully mitigates the easily paralyzing sense of responsibility and prevents us from taking ourselves and other people all too seriously; it is conducive to a view of life which, in particular, gives humor its due.&lt;br /&gt;
&lt;br /&gt;
To inquire after the meaning or object of one's own existence or that of all creatures has always seemed to me absurd from an objective point of view. And yet everybody has certain ideals which determine the direction of his endeavors and his judgments. In this sense I have never looked upon ease and happiness as ends in themselves—this ethical basis I call the ideal of a pigsty. The ideals which have lighted my way, and time after time have given me new courage to face life cheerfully, have been Kindness, Beauty, and Truth. Without the sense of kinship with men of like mind, without the occupation with the objective world, the eternally unattainable in the field of art and scientific endeavors, life would have seemed to me empty. The trite objects of human efforts—possessions, outward success, luxury—have always seemed to me contemptible.&lt;br /&gt;
&lt;br /&gt;
My passionate sense of social justice and social responsibility has always contrasted oddly with my pronounced lack of need for direct contact with other human beings and human communities. I am truly a &amp;quot;lone traveler&amp;quot; and have never belonged to my country, my home, my friend, or even my immediate family, with my whole heart; in the face of all these ties, I have never lost a sense of distance and a need for solitude—feelings which increase with the years. One becomes sharply aware, but without regret, of the limits of mutual understanding and consonance with other people. No doubt, such a person loses some of his innocence and unconcern; on the other hand, he is largely independent of the opinions, habits, and judgments of his fellows and avoids the temptation to build his inner equilibrium upon such insecure foundations.&lt;br /&gt;
&lt;br /&gt;
My political ideal is democracy. Let every man be respected as an individual and no man idolized. It is an irony of fate that I myself have been the recipient of excessive admiration and reverence from my fellow-beings, through no fault, and no merit, of my own. The cause of this may well be the desire, unattainable for many, to understand the few ideas to which I have with my feeble powers attained through ceaseless struggle. I have an unequivocal belief that the really valuable thing in the sense of achievement is not the political state but the creative, sentient individual, the personality; that it alone creates the noble and sublime, while the herd as such is dull in thought and dull in feeling.&lt;br /&gt;
&lt;br /&gt;
Speaking of the herd, I am notably referring to the worst of its manifestations, the military system, which I loathe. A person who can take pleasure in marching in rank and file to the strains of a band is beneath my contempt; he received his great brain by mistake—for him the spinal cord would have been amply sufficient. This plague spot of civilization ought to be abolished as soon as possible. Heroism on command, senseless violence, and all the loathsome nonsense that goes by the name of patriotism—how I hate them! War seems to me a mean, contemptible thing; I would rather be hacked in pieces than take part in such an abominable business. And yet, I still believe that, but for the pernicious influence of commercial and political interests which systematically corrupt the health of the people through schools and the press, the horror of war would have disappeared long ago.&lt;br /&gt;
&lt;br /&gt;
The most beautiful experience we can have is the mysterious. It is the fundamental emotion that stands at the cradle of true art and true science. Whoever does not know it and can no longer wonder, no longer marvel, is as good as dead, and his eyes are dimmed. It was the experience of mystery—even if mixed with fear—that engendered religion. A knowledge of the existence of something we cannot penetrate, of the manifestations of the profoundest reason and the most radiant beauty, which are only accessible to our reason in their most elementary forms—it is this knowledge and this emotion that constitute the truly religious attitude; in this sense, and only in this sense, I am a deeply religious man. I cannot conceive of a God who rewards and punishes his creatures, or has a will of the kind that we experience in ourselves. Neither can I nor would I want to conceive of an individual that survives his physical death; let feeble souls, from fear or absurd egoism, cherish such thoughts. I am satisfied with the mystery of the eternity of life and with the awareness and a glimpse of the marvelous structure of the existing world, together with the devoted striving to comprehend a portion, be it ever so tiny, of the Reason that manifests itself in nature.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 中文对照译文 ==&lt;br /&gt;
&lt;br /&gt;
* 许良英、赵中立、张宣三编译，选自商务印书馆《爱因斯坦文集》第三卷&lt;br /&gt;
&lt;br /&gt;
我们这些总有一死的人的命运是多么奇特呀！我们每个人在这个世界上都只作一个短暂的逗留；目的何在，却无所知，尽管有时自以为对此若有所感。但是，不必深思，只要从日常生活就可以明白：人是为别人而生存的——首先是为那样一些人，他们的喜悦和健康关系着我们自己的全部幸福；然后是为许多我们所不认识的人，他们的命运通过同情的纽带同我们密切结合在一起。我每天上百次地提醒自己：我的精神生活和物质生活都依靠着别人（包括生者和死者）的劳动，我必须尽力以同样的分量来报偿我所领受了的和至今还在领受着的东西。我强烈地向往着俭朴的生活，并且时常为发觉自己占用了同胞的过多劳动而难以忍受。我认为阶级的区分是不合理的，它最后所凭借的是以暴力为根据。我也相信，简单淳朴的生活，无论在身体上还是在精神上，对每个人都是有益的。&lt;br /&gt;
&lt;br /&gt;
我完全不相信人类会有那种在哲学意义上的自由。每一个人的行为，不仅受着外界的强迫，而且还要适应内心的必然。叔本华说：“人虽然能够做他所想做的，但不能要他所想要的。”这句话从我青年时代起，就对我是一个真正的启示；在我自己和别人生活面临困难的时候，它总是使我们得到安慰，并且永远是宽容的源泉。这种体会可以宽大为怀地减轻那种使人气馁的责任感，也可以防止我们过于严肃地对待自己和别人；它还导致一种特别给幽默以应有地位的人生观。&lt;br /&gt;
&lt;br /&gt;
要追究一个人自己或一切生物生存的意义或目的，从客观的观点看来，我总觉得是愚蠢可笑的。可是每个人都有一定的理想，这种理想决定着他的努力和判断的方向。就在这个意义上，我从来不把安逸和享乐看作是生活目的本身——这种伦理基础，我叫它猪栏的理想。照亮我的道路，并且不断地给我新的勇气去愉快地正视生活的理想，是真、善和美。要是没有志同道合者之间的亲切感情，要不是全神贯注于客观世界——那个在艺术和科学工作领域里永远达不到的对象，那么在我看来，生活就会是空虚的。人们所努力追求的庸俗的目标——财产、虚荣、奢侈的生活——我总觉得都是可鄙的。&lt;br /&gt;
&lt;br /&gt;
我对社会正义和社会责任的强烈感觉，同我显然的对别人和社会直接接触的淡漠，两者总是形成古怪的对照。我实在是一个“孤独的旅客”，我未曾全心全意地属于我的国家，我的家庭，我的朋友，甚至我最接近的亲人；在所有这些关系面前，我总是感觉到有一定距离并且需要保持孤独——而这种感受正与年俱增。人们会清楚地发觉，同别人的相互了解和协调一致是有限度的，但这不足惋惜。这样的人无疑有点失去他的天真无邪和无忧无虑的心境；但另一方面，他却能够在很大程度上不为别人的意见、习惯和判断所左右，并且能够不受诱惑要去把他的内心平衡在这样一些不可靠的基础之上。&lt;br /&gt;
&lt;br /&gt;
我的政治理想是民主主义。让每一个人都作为个人而受到尊重，而不让任何人成为崇拜的偶像。我自己受到了人们过分的赞扬和尊敬，这不是由于我自己的过错，也不是由于我自己的功劳，而实在是一种命运的嘲弄。其原因大概在于人们有一种愿望，想理解我以自己的微薄绵力通过不断的斗争所获得的少数几个观念，而这种愿望有很多人却未能实现。我完全明白，一个组织要实现它的目的，就必须有一个人去思考，去指挥，并且全面负担起责任来。但是被领导的人不应当受到压迫，他们必须有可能来选择自己的领袖。在我看来，强迫的专制制度很快就会腐化堕落。因为暴力所招引来的总是一些品德低劣的人，而且我相信，天才的暴君总是由无赖来继承，这是一条千古不易的规律。就是这个缘故，我总是强烈地反对今天我们在意大利和俄国所见到的那种制度。像欧洲今天所存在的情况，使得民主形式受到了怀疑，这不能归咎于民主原则本身，而是由于政府的不稳定和选举制度中与个人无关的特征。我相信美国在这方面已经找到了正确的道路。他们选出了一个任期足够长的总统，他有充分的权力来真正履行他的职责。另一方面，在德国的政治制度中，我所重视的是，它为救济患病或贫困的人作出了比较广泛的规定。在人生的丰富多彩的表演中，我觉得真正可贵的，不是政治上的国家，而是有创造性的、有感情的个人，是人格；只有个人才能创造出高尚的和卓越的东西，而群众本身在思想上总是迟钝的，在感觉上也总是迟钝的。&lt;br /&gt;
&lt;br /&gt;
讲到这里，我想起了群众生活中最坏的一种表现，那就是使我厌恶的军事制度。一个人能够洋洋得意地随着军乐队在四列纵队里行进，单凭这一点就足以使我对他轻视。他所以长了一个大脑，只是出于误会；单单一根脊髓就可满足他的全部需要了。文明国家的这种罪恶的渊薮，应当尽快加以消灭。由命令而产生的勇敢行为，毫无意义的暴行，以及在爱国主义名义下一切可恶的胡闹，所有这些都使我深恶痛绝！在我看来，战争是多么卑鄙、下流！我宁愿被千刀万剐，也不愿参预这种可憎的勾当。尽管如此，我对人类的评价还是十分高的，我相信，要是人民的健康感情没有被那些通过学校和报纸而起作用的商业利益和政治利益蓄意进行败坏，那么战争这个妖魔早就该绝迹了。&lt;br /&gt;
&lt;br /&gt;
我们所能有的最美好的经验是奥秘的经验。它是坚守在真正艺术和真正科学发源地上的基本感情。谁要是体验不到它，谁要是不再有好奇心也不再有惊讶的感觉，他就无异于行尸走肉，他的眼睛是迷糊不清的。就是这样奥秘的经验——虽然掺杂着恐怖——产生了宗教。我们认识到有某种为我们所不能洞察的东西存在，感觉到那种只能以其最原始的形式为我们感受到的最深奥的理性和最灿烂的美——正是这种认识和这种情感构成了真正的宗教感情；在这个意义上，而且也只是在这个意义上，我才是一个具有深挚的宗教感情的人。我无法想象一个会对自己的创造物加以赏罚的上帝，也无法想象它会有像在我们自己身上所体验到的那样一种意志。我不能也不愿去想象一个人在肉体死亡以后还会继续活着；让那些脆弱的灵魂，由于恐惧或者由于可笑的唯我论，去拿这种思想当宝贝吧！我自己只求满足于生命永恒的奥秘，满足于觉察现实世界的神奇的结构，窥见它的一鳞半爪，并且以诚挚的努力去领悟在自然界中显示出来的那个理性的一部分，即使只是其极小的一部分，我也就心满意足了。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 版本说明 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
*德文标题: Mein Glaubensbekenntnis &lt;br /&gt;
*写作时间: 1930年夏天 &lt;br /&gt;
* 写作地点: 柏林郊外卡普特（Caputh）消夏小屋 &lt;br /&gt;
* 首次发表: 《论坛与世纪》（''Forum and Century''）第84卷，193-194页，1930年10月 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
该文也以《我的世界观》（''The World As I See It'' / ''Mein Weltbild''）为题收录于爱因斯坦的多部文集中。文中引用的叔本华格言“人虽然能够做他所想做的，但不能要他所想要的”是理解爱因斯坦人生观的关键线索。&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6219</id>
		<title>What-i-believe-Einstein</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6219"/>
		<updated>2026-06-02T03:09:39Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 版本说明 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
* 以下是爱因斯坦 '''《我的信仰》（What I Believe）''' 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（''Forum and Century''）杂志第84卷。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== What I Believe ==&lt;br /&gt;
* By Albert Einstein&lt;br /&gt;
&lt;br /&gt;
How strange is the lot of us mortals! Each of us is here for a brief sojourn; for what purpose he knows not, though he sometimes thinks he senses it. But without deeper reflection one knows from daily life that one exists for other people—first of all for those upon whose smiles and well-being our own happiness is wholly dependent, and then for the many, unknown to us, to whose destinies we are bound by the ties of sympathy. A hundred times every day I remind myself that my inner and outer life are based on the labors of other men, living and dead, and that I must exert myself in order to give in the same measure as I have received and am still receiving. I am strongly drawn to a frugal life and am often oppressively aware that I am engrossing an undue amount of the labor of my fellow-men. I regard class distinctions as unjustified and, in the last resort, based on force. I also believe that a simple and unassuming life is good for everybody, physically and mentally.&lt;br /&gt;
&lt;br /&gt;
I do not at all believe in human freedom in the philosophical sense. Everybody acts not only under external compulsion but also in accordance with inner necessity. Schopenhauer's saying, &amp;quot;A man can do what he wants, but not want what he wants,&amp;quot; has been a very real inspiration to me since my youth; it has been a continual consolation in the face of life's hardships, my own and others', and an unfailing well-spring of tolerance. This realization mercifully mitigates the easily paralyzing sense of responsibility and prevents us from taking ourselves and other people all too seriously; it is conducive to a view of life which, in particular, gives humor its due.&lt;br /&gt;
&lt;br /&gt;
To inquire after the meaning or object of one's own existence or that of all creatures has always seemed to me absurd from an objective point of view. And yet everybody has certain ideals which determine the direction of his endeavors and his judgments. In this sense I have never looked upon ease and happiness as ends in themselves—this ethical basis I call the ideal of a pigsty. The ideals which have lighted my way, and time after time have given me new courage to face life cheerfully, have been Kindness, Beauty, and Truth. Without the sense of kinship with men of like mind, without the occupation with the objective world, the eternally unattainable in the field of art and scientific endeavors, life would have seemed to me empty. The trite objects of human efforts—possessions, outward success, luxury—have always seemed to me contemptible.&lt;br /&gt;
&lt;br /&gt;
My passionate sense of social justice and social responsibility has always contrasted oddly with my pronounced lack of need for direct contact with other human beings and human communities. I am truly a &amp;quot;lone traveler&amp;quot; and have never belonged to my country, my home, my friend, or even my immediate family, with my whole heart; in the face of all these ties, I have never lost a sense of distance and a need for solitude—feelings which increase with the years. One becomes sharply aware, but without regret, of the limits of mutual understanding and consonance with other people. No doubt, such a person loses some of his innocence and unconcern; on the other hand, he is largely independent of the opinions, habits, and judgments of his fellows and avoids the temptation to build his inner equilibrium upon such insecure foundations.&lt;br /&gt;
&lt;br /&gt;
My political ideal is democracy. Let every man be respected as an individual and no man idolized. It is an irony of fate that I myself have been the recipient of excessive admiration and reverence from my fellow-beings, through no fault, and no merit, of my own. The cause of this may well be the desire, unattainable for many, to understand the few ideas to which I have with my feeble powers attained through ceaseless struggle. I have an unequivocal belief that the really valuable thing in the sense of achievement is not the political state but the creative, sentient individual, the personality; that it alone creates the noble and sublime, while the herd as such is dull in thought and dull in feeling.&lt;br /&gt;
&lt;br /&gt;
Speaking of the herd, I am notably referring to the worst of its manifestations, the military system, which I loathe. A person who can take pleasure in marching in rank and file to the strains of a band is beneath my contempt; he received his great brain by mistake—for him the spinal cord would have been amply sufficient. This plague spot of civilization ought to be abolished as soon as possible. Heroism on command, senseless violence, and all the loathsome nonsense that goes by the name of patriotism—how I hate them! War seems to me a mean, contemptible thing; I would rather be hacked in pieces than take part in such an abominable business. And yet, I still believe that, but for the pernicious influence of commercial and political interests which systematically corrupt the health of the people through schools and the press, the horror of war would have disappeared long ago.&lt;br /&gt;
&lt;br /&gt;
The most beautiful experience we can have is the mysterious. It is the fundamental emotion that stands at the cradle of true art and true science. Whoever does not know it and can no longer wonder, no longer marvel, is as good as dead, and his eyes are dimmed. It was the experience of mystery—even if mixed with fear—that engendered religion. A knowledge of the existence of something we cannot penetrate, of the manifestations of the profoundest reason and the most radiant beauty, which are only accessible to our reason in their most elementary forms—it is this knowledge and this emotion that constitute the truly religious attitude; in this sense, and only in this sense, I am a deeply religious man. I cannot conceive of a God who rewards and punishes his creatures, or has a will of the kind that we experience in ourselves. Neither can I nor would I want to conceive of an individual that survives his physical death; let feeble souls, from fear or absurd egoism, cherish such thoughts. I am satisfied with the mystery of the eternity of life and with the awareness and a glimpse of the marvelous structure of the existing world, together with the devoted striving to comprehend a portion, be it ever so tiny, of the Reason that manifests itself in nature.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 中文对照译文 ==&lt;br /&gt;
&lt;br /&gt;
* 许良英、赵中立、张宣三编译，选自商务印书馆《爱因斯坦文集》第三卷&lt;br /&gt;
&lt;br /&gt;
我们这些总有一死的人的命运是多么奇特呀！我们每个人在这个世界上都只作一个短暂的逗留；目的何在，却无所知，尽管有时自以为对此若有所感。但是，不必深思，只要从日常生活就可以明白：人是为别人而生存的——首先是为那样一些人，他们的喜悦和健康关系着我们自己的全部幸福；然后是为许多我们所不认识的人，他们的命运通过同情的纽带同我们密切结合在一起。我每天上百次地提醒自己：我的精神生活和物质生活都依靠着别人（包括生者和死者）的劳动，我必须尽力以同样的分量来报偿我所领受了的和至今还在领受着的东西。我强烈地向往着俭朴的生活，并且时常为发觉自己占用了同胞的过多劳动而难以忍受。我认为阶级的区分是不合理的，它最后所凭借的是以暴力为根据。我也相信，简单淳朴的生活，无论在身体上还是在精神上，对每个人都是有益的。&lt;br /&gt;
&lt;br /&gt;
我完全不相信人类会有那种在哲学意义上的自由。每一个人的行为，不仅受着外界的强迫，而且还要适应内心的必然。叔本华说：“人虽然能够做他所想做的，但不能要他所想要的。”这句话从我青年时代起，就对我是一个真正的启示；在我自己和别人生活面临困难的时候，它总是使我们得到安慰，并且永远是宽容的源泉。这种体会可以宽大为怀地减轻那种使人气馁的责任感，也可以防止我们过于严肃地对待自己和别人；它还导致一种特别给幽默以应有地位的人生观。&lt;br /&gt;
&lt;br /&gt;
要追究一个人自己或一切生物生存的意义或目的，从客观的观点看来，我总觉得是愚蠢可笑的。可是每个人都有一定的理想，这种理想决定着他的努力和判断的方向。就在这个意义上，我从来不把安逸和享乐看作是生活目的本身——这种伦理基础，我叫它猪栏的理想。照亮我的道路，并且不断地给我新的勇气去愉快地正视生活的理想，是真、善和美。要是没有志同道合者之间的亲切感情，要不是全神贯注于客观世界——那个在艺术和科学工作领域里永远达不到的对象，那么在我看来，生活就会是空虚的。人们所努力追求的庸俗的目标——财产、虚荣、奢侈的生活——我总觉得都是可鄙的。&lt;br /&gt;
&lt;br /&gt;
我对社会正义和社会责任的强烈感觉，同我显然的对别人和社会直接接触的淡漠，两者总是形成古怪的对照。我实在是一个“孤独的旅客”，我未曾全心全意地属于我的国家，我的家庭，我的朋友，甚至我最接近的亲人；在所有这些关系面前，我总是感觉到有一定距离并且需要保持孤独——而这种感受正与年俱增。人们会清楚地发觉，同别人的相互了解和协调一致是有限度的，但这不足惋惜。这样的人无疑有点失去他的天真无邪和无忧无虑的心境；但另一方面，他却能够在很大程度上不为别人的意见、习惯和判断所左右，并且能够不受诱惑要去把他的内心平衡在这样一些不可靠的基础之上。&lt;br /&gt;
&lt;br /&gt;
我的政治理想是民主主义。让每一个人都作为个人而受到尊重，而不让任何人成为崇拜的偶像。我自己受到了人们过分的赞扬和尊敬，这不是由于我自己的过错，也不是由于我自己的功劳，而实在是一种命运的嘲弄。其原因大概在于人们有一种愿望，想理解我以自己的微薄绵力通过不断的斗争所获得的少数几个观念，而这种愿望有很多人却未能实现。我完全明白，一个组织要实现它的目的，就必须有一个人去思考，去指挥，并且全面负担起责任来。但是被领导的人不应当受到压迫，他们必须有可能来选择自己的领袖。在我看来，强迫的专制制度很快就会腐化堕落。因为暴力所招引来的总是一些品德低劣的人，而且我相信，天才的暴君总是由无赖来继承，这是一条千古不易的规律。就是这个缘故，我总是强烈地反对今天我们在意大利和俄国所见到的那种制度。像欧洲今天所存在的情况，使得民主形式受到了怀疑，这不能归咎于民主原则本身，而是由于政府的不稳定和选举制度中与个人无关的特征。我相信美国在这方面已经找到了正确的道路。他们选出了一个任期足够长的总统，他有充分的权力来真正履行他的职责。另一方面，在德国的政治制度中，我所重视的是，它为救济患病或贫困的人作出了比较广泛的规定。在人生的丰富多彩的表演中，我觉得真正可贵的，不是政治上的国家，而是有创造性的、有感情的个人，是人格；只有个人才能创造出高尚的和卓越的东西，而群众本身在思想上总是迟钝的，在感觉上也总是迟钝的。&lt;br /&gt;
&lt;br /&gt;
讲到这里，我想起了群众生活中最坏的一种表现，那就是使我厌恶的军事制度。一个人能够洋洋得意地随着军乐队在四列纵队里行进，单凭这一点就足以使我对他轻视。他所以长了一个大脑，只是出于误会；单单一根脊髓就可满足他的全部需要了。文明国家的这种罪恶的渊薮，应当尽快加以消灭。由命令而产生的勇敢行为，毫无意义的暴行，以及在爱国主义名义下一切可恶的胡闹，所有这些都使我深恶痛绝！在我看来，战争是多么卑鄙、下流！我宁愿被千刀万剐，也不愿参预这种可憎的勾当。尽管如此，我对人类的评价还是十分高的，我相信，要是人民的健康感情没有被那些通过学校和报纸而起作用的商业利益和政治利益蓄意进行败坏，那么战争这个妖魔早就该绝迹了。&lt;br /&gt;
&lt;br /&gt;
我们所能有的最美好的经验是奥秘的经验。它是坚守在真正艺术和真正科学发源地上的基本感情。谁要是体验不到它，谁要是不再有好奇心也不再有惊讶的感觉，他就无异于行尸走肉，他的眼睛是迷糊不清的。就是这样奥秘的经验——虽然掺杂着恐怖——产生了宗教。我们认识到有某种为我们所不能洞察的东西存在，感觉到那种只能以其最原始的形式为我们感受到的最深奥的理性和最灿烂的美——正是这种认识和这种情感构成了真正的宗教感情；在这个意义上，而且也只是在这个意义上，我才是一个具有深挚的宗教感情的人。我无法想象一个会对自己的创造物加以赏罚的上帝，也无法想象它会有像在我们自己身上所体验到的那样一种意志。我不能也不愿去想象一个人在肉体死亡以后还会继续活着；让那些脆弱的灵魂，由于恐惧或者由于可笑的唯我论，去拿这种思想当宝贝吧！我自己只求满足于生命永恒的奥秘，满足于觉察现实世界的神奇的结构，窥见它的一鳞半爪，并且以诚挚的努力去领悟在自然界中显示出来的那个理性的一部分，即使只是其极小的一部分，我也就心满意足了。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 版本说明 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
*德文标题: Mein Glaubensbekenntnis &lt;br /&gt;
*写作时间: 1930年夏天 &lt;br /&gt;
* 写作地点: 柏林郊外卡普特（Caputh）消夏小屋 &lt;br /&gt;
* 首次发表: 《论坛与世纪》（''Forum and Century''）第84卷，193-194页，1930年10月 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
该文也以《我的世界观》（''The World As I See It'' / ''Mein Weltbild''）为题收录于爱因斯坦的多部文集中。文中引用的叔本华格言“人虽然能够做他所想做的，但不能要他所想要的”是理解爱因斯坦人生观的关键线索。&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6218</id>
		<title>What-i-believe-Einstein</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6218"/>
		<updated>2026-06-02T03:09:30Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 版本说明 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
* 以下是爱因斯坦 '''《我的信仰》（What I Believe）''' 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（''Forum and Century''）杂志第84卷。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== What I Believe ==&lt;br /&gt;
* By Albert Einstein&lt;br /&gt;
&lt;br /&gt;
How strange is the lot of us mortals! Each of us is here for a brief sojourn; for what purpose he knows not, though he sometimes thinks he senses it. But without deeper reflection one knows from daily life that one exists for other people—first of all for those upon whose smiles and well-being our own happiness is wholly dependent, and then for the many, unknown to us, to whose destinies we are bound by the ties of sympathy. A hundred times every day I remind myself that my inner and outer life are based on the labors of other men, living and dead, and that I must exert myself in order to give in the same measure as I have received and am still receiving. I am strongly drawn to a frugal life and am often oppressively aware that I am engrossing an undue amount of the labor of my fellow-men. I regard class distinctions as unjustified and, in the last resort, based on force. I also believe that a simple and unassuming life is good for everybody, physically and mentally.&lt;br /&gt;
&lt;br /&gt;
I do not at all believe in human freedom in the philosophical sense. Everybody acts not only under external compulsion but also in accordance with inner necessity. Schopenhauer's saying, &amp;quot;A man can do what he wants, but not want what he wants,&amp;quot; has been a very real inspiration to me since my youth; it has been a continual consolation in the face of life's hardships, my own and others', and an unfailing well-spring of tolerance. This realization mercifully mitigates the easily paralyzing sense of responsibility and prevents us from taking ourselves and other people all too seriously; it is conducive to a view of life which, in particular, gives humor its due.&lt;br /&gt;
&lt;br /&gt;
To inquire after the meaning or object of one's own existence or that of all creatures has always seemed to me absurd from an objective point of view. And yet everybody has certain ideals which determine the direction of his endeavors and his judgments. In this sense I have never looked upon ease and happiness as ends in themselves—this ethical basis I call the ideal of a pigsty. The ideals which have lighted my way, and time after time have given me new courage to face life cheerfully, have been Kindness, Beauty, and Truth. Without the sense of kinship with men of like mind, without the occupation with the objective world, the eternally unattainable in the field of art and scientific endeavors, life would have seemed to me empty. The trite objects of human efforts—possessions, outward success, luxury—have always seemed to me contemptible.&lt;br /&gt;
&lt;br /&gt;
My passionate sense of social justice and social responsibility has always contrasted oddly with my pronounced lack of need for direct contact with other human beings and human communities. I am truly a &amp;quot;lone traveler&amp;quot; and have never belonged to my country, my home, my friend, or even my immediate family, with my whole heart; in the face of all these ties, I have never lost a sense of distance and a need for solitude—feelings which increase with the years. One becomes sharply aware, but without regret, of the limits of mutual understanding and consonance with other people. No doubt, such a person loses some of his innocence and unconcern; on the other hand, he is largely independent of the opinions, habits, and judgments of his fellows and avoids the temptation to build his inner equilibrium upon such insecure foundations.&lt;br /&gt;
&lt;br /&gt;
My political ideal is democracy. Let every man be respected as an individual and no man idolized. It is an irony of fate that I myself have been the recipient of excessive admiration and reverence from my fellow-beings, through no fault, and no merit, of my own. The cause of this may well be the desire, unattainable for many, to understand the few ideas to which I have with my feeble powers attained through ceaseless struggle. I have an unequivocal belief that the really valuable thing in the sense of achievement is not the political state but the creative, sentient individual, the personality; that it alone creates the noble and sublime, while the herd as such is dull in thought and dull in feeling.&lt;br /&gt;
&lt;br /&gt;
Speaking of the herd, I am notably referring to the worst of its manifestations, the military system, which I loathe. A person who can take pleasure in marching in rank and file to the strains of a band is beneath my contempt; he received his great brain by mistake—for him the spinal cord would have been amply sufficient. This plague spot of civilization ought to be abolished as soon as possible. Heroism on command, senseless violence, and all the loathsome nonsense that goes by the name of patriotism—how I hate them! War seems to me a mean, contemptible thing; I would rather be hacked in pieces than take part in such an abominable business. And yet, I still believe that, but for the pernicious influence of commercial and political interests which systematically corrupt the health of the people through schools and the press, the horror of war would have disappeared long ago.&lt;br /&gt;
&lt;br /&gt;
The most beautiful experience we can have is the mysterious. It is the fundamental emotion that stands at the cradle of true art and true science. Whoever does not know it and can no longer wonder, no longer marvel, is as good as dead, and his eyes are dimmed. It was the experience of mystery—even if mixed with fear—that engendered religion. A knowledge of the existence of something we cannot penetrate, of the manifestations of the profoundest reason and the most radiant beauty, which are only accessible to our reason in their most elementary forms—it is this knowledge and this emotion that constitute the truly religious attitude; in this sense, and only in this sense, I am a deeply religious man. I cannot conceive of a God who rewards and punishes his creatures, or has a will of the kind that we experience in ourselves. Neither can I nor would I want to conceive of an individual that survives his physical death; let feeble souls, from fear or absurd egoism, cherish such thoughts. I am satisfied with the mystery of the eternity of life and with the awareness and a glimpse of the marvelous structure of the existing world, together with the devoted striving to comprehend a portion, be it ever so tiny, of the Reason that manifests itself in nature.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 中文对照译文 ==&lt;br /&gt;
&lt;br /&gt;
* 许良英、赵中立、张宣三编译，选自商务印书馆《爱因斯坦文集》第三卷&lt;br /&gt;
&lt;br /&gt;
我们这些总有一死的人的命运是多么奇特呀！我们每个人在这个世界上都只作一个短暂的逗留；目的何在，却无所知，尽管有时自以为对此若有所感。但是，不必深思，只要从日常生活就可以明白：人是为别人而生存的——首先是为那样一些人，他们的喜悦和健康关系着我们自己的全部幸福；然后是为许多我们所不认识的人，他们的命运通过同情的纽带同我们密切结合在一起。我每天上百次地提醒自己：我的精神生活和物质生活都依靠着别人（包括生者和死者）的劳动，我必须尽力以同样的分量来报偿我所领受了的和至今还在领受着的东西。我强烈地向往着俭朴的生活，并且时常为发觉自己占用了同胞的过多劳动而难以忍受。我认为阶级的区分是不合理的，它最后所凭借的是以暴力为根据。我也相信，简单淳朴的生活，无论在身体上还是在精神上，对每个人都是有益的。&lt;br /&gt;
&lt;br /&gt;
我完全不相信人类会有那种在哲学意义上的自由。每一个人的行为，不仅受着外界的强迫，而且还要适应内心的必然。叔本华说：“人虽然能够做他所想做的，但不能要他所想要的。”这句话从我青年时代起，就对我是一个真正的启示；在我自己和别人生活面临困难的时候，它总是使我们得到安慰，并且永远是宽容的源泉。这种体会可以宽大为怀地减轻那种使人气馁的责任感，也可以防止我们过于严肃地对待自己和别人；它还导致一种特别给幽默以应有地位的人生观。&lt;br /&gt;
&lt;br /&gt;
要追究一个人自己或一切生物生存的意义或目的，从客观的观点看来，我总觉得是愚蠢可笑的。可是每个人都有一定的理想，这种理想决定着他的努力和判断的方向。就在这个意义上，我从来不把安逸和享乐看作是生活目的本身——这种伦理基础，我叫它猪栏的理想。照亮我的道路，并且不断地给我新的勇气去愉快地正视生活的理想，是真、善和美。要是没有志同道合者之间的亲切感情，要不是全神贯注于客观世界——那个在艺术和科学工作领域里永远达不到的对象，那么在我看来，生活就会是空虚的。人们所努力追求的庸俗的目标——财产、虚荣、奢侈的生活——我总觉得都是可鄙的。&lt;br /&gt;
&lt;br /&gt;
我对社会正义和社会责任的强烈感觉，同我显然的对别人和社会直接接触的淡漠，两者总是形成古怪的对照。我实在是一个“孤独的旅客”，我未曾全心全意地属于我的国家，我的家庭，我的朋友，甚至我最接近的亲人；在所有这些关系面前，我总是感觉到有一定距离并且需要保持孤独——而这种感受正与年俱增。人们会清楚地发觉，同别人的相互了解和协调一致是有限度的，但这不足惋惜。这样的人无疑有点失去他的天真无邪和无忧无虑的心境；但另一方面，他却能够在很大程度上不为别人的意见、习惯和判断所左右，并且能够不受诱惑要去把他的内心平衡在这样一些不可靠的基础之上。&lt;br /&gt;
&lt;br /&gt;
我的政治理想是民主主义。让每一个人都作为个人而受到尊重，而不让任何人成为崇拜的偶像。我自己受到了人们过分的赞扬和尊敬，这不是由于我自己的过错，也不是由于我自己的功劳，而实在是一种命运的嘲弄。其原因大概在于人们有一种愿望，想理解我以自己的微薄绵力通过不断的斗争所获得的少数几个观念，而这种愿望有很多人却未能实现。我完全明白，一个组织要实现它的目的，就必须有一个人去思考，去指挥，并且全面负担起责任来。但是被领导的人不应当受到压迫，他们必须有可能来选择自己的领袖。在我看来，强迫的专制制度很快就会腐化堕落。因为暴力所招引来的总是一些品德低劣的人，而且我相信，天才的暴君总是由无赖来继承，这是一条千古不易的规律。就是这个缘故，我总是强烈地反对今天我们在意大利和俄国所见到的那种制度。像欧洲今天所存在的情况，使得民主形式受到了怀疑，这不能归咎于民主原则本身，而是由于政府的不稳定和选举制度中与个人无关的特征。我相信美国在这方面已经找到了正确的道路。他们选出了一个任期足够长的总统，他有充分的权力来真正履行他的职责。另一方面，在德国的政治制度中，我所重视的是，它为救济患病或贫困的人作出了比较广泛的规定。在人生的丰富多彩的表演中，我觉得真正可贵的，不是政治上的国家，而是有创造性的、有感情的个人，是人格；只有个人才能创造出高尚的和卓越的东西，而群众本身在思想上总是迟钝的，在感觉上也总是迟钝的。&lt;br /&gt;
&lt;br /&gt;
讲到这里，我想起了群众生活中最坏的一种表现，那就是使我厌恶的军事制度。一个人能够洋洋得意地随着军乐队在四列纵队里行进，单凭这一点就足以使我对他轻视。他所以长了一个大脑，只是出于误会；单单一根脊髓就可满足他的全部需要了。文明国家的这种罪恶的渊薮，应当尽快加以消灭。由命令而产生的勇敢行为，毫无意义的暴行，以及在爱国主义名义下一切可恶的胡闹，所有这些都使我深恶痛绝！在我看来，战争是多么卑鄙、下流！我宁愿被千刀万剐，也不愿参预这种可憎的勾当。尽管如此，我对人类的评价还是十分高的，我相信，要是人民的健康感情没有被那些通过学校和报纸而起作用的商业利益和政治利益蓄意进行败坏，那么战争这个妖魔早就该绝迹了。&lt;br /&gt;
&lt;br /&gt;
我们所能有的最美好的经验是奥秘的经验。它是坚守在真正艺术和真正科学发源地上的基本感情。谁要是体验不到它，谁要是不再有好奇心也不再有惊讶的感觉，他就无异于行尸走肉，他的眼睛是迷糊不清的。就是这样奥秘的经验——虽然掺杂着恐怖——产生了宗教。我们认识到有某种为我们所不能洞察的东西存在，感觉到那种只能以其最原始的形式为我们感受到的最深奥的理性和最灿烂的美——正是这种认识和这种情感构成了真正的宗教感情；在这个意义上，而且也只是在这个意义上，我才是一个具有深挚的宗教感情的人。我无法想象一个会对自己的创造物加以赏罚的上帝，也无法想象它会有像在我们自己身上所体验到的那样一种意志。我不能也不愿去想象一个人在肉体死亡以后还会继续活着；让那些脆弱的灵魂，由于恐惧或者由于可笑的唯我论，去拿这种思想当宝贝吧！我自己只求满足于生命永恒的奥秘，满足于觉察现实世界的神奇的结构，窥见它的一鳞半爪，并且以诚挚的努力去领悟在自然界中显示出来的那个理性的一部分，即使只是其极小的一部分，我也就心满意足了。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 版本说明 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
*德文标题: Mein Glaubensbekenntnis &lt;br /&gt;
*写作时间: 1930年夏天 &lt;br /&gt;
写作地点: 柏林郊外卡普特（Caputh）消夏小屋 &lt;br /&gt;
首次发表: 《论坛与世纪》（''Forum and Century''）第84卷，193-194页，1930年10月 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
该文也以《我的世界观》（''The World As I See It'' / ''Mein Weltbild''）为题收录于爱因斯坦的多部文集中。文中引用的叔本华格言“人虽然能够做他所想做的，但不能要他所想要的”是理解爱因斯坦人生观的关键线索。&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6217</id>
		<title>What-i-believe-Einstein</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6217"/>
		<updated>2026-06-02T03:07:25Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
* 以下是爱因斯坦 '''《我的信仰》（What I Believe）''' 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（''Forum and Century''）杂志第84卷。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== What I Believe ==&lt;br /&gt;
* By Albert Einstein&lt;br /&gt;
&lt;br /&gt;
How strange is the lot of us mortals! Each of us is here for a brief sojourn; for what purpose he knows not, though he sometimes thinks he senses it. But without deeper reflection one knows from daily life that one exists for other people—first of all for those upon whose smiles and well-being our own happiness is wholly dependent, and then for the many, unknown to us, to whose destinies we are bound by the ties of sympathy. A hundred times every day I remind myself that my inner and outer life are based on the labors of other men, living and dead, and that I must exert myself in order to give in the same measure as I have received and am still receiving. I am strongly drawn to a frugal life and am often oppressively aware that I am engrossing an undue amount of the labor of my fellow-men. I regard class distinctions as unjustified and, in the last resort, based on force. I also believe that a simple and unassuming life is good for everybody, physically and mentally.&lt;br /&gt;
&lt;br /&gt;
I do not at all believe in human freedom in the philosophical sense. Everybody acts not only under external compulsion but also in accordance with inner necessity. Schopenhauer's saying, &amp;quot;A man can do what he wants, but not want what he wants,&amp;quot; has been a very real inspiration to me since my youth; it has been a continual consolation in the face of life's hardships, my own and others', and an unfailing well-spring of tolerance. This realization mercifully mitigates the easily paralyzing sense of responsibility and prevents us from taking ourselves and other people all too seriously; it is conducive to a view of life which, in particular, gives humor its due.&lt;br /&gt;
&lt;br /&gt;
To inquire after the meaning or object of one's own existence or that of all creatures has always seemed to me absurd from an objective point of view. And yet everybody has certain ideals which determine the direction of his endeavors and his judgments. In this sense I have never looked upon ease and happiness as ends in themselves—this ethical basis I call the ideal of a pigsty. The ideals which have lighted my way, and time after time have given me new courage to face life cheerfully, have been Kindness, Beauty, and Truth. Without the sense of kinship with men of like mind, without the occupation with the objective world, the eternally unattainable in the field of art and scientific endeavors, life would have seemed to me empty. The trite objects of human efforts—possessions, outward success, luxury—have always seemed to me contemptible.&lt;br /&gt;
&lt;br /&gt;
My passionate sense of social justice and social responsibility has always contrasted oddly with my pronounced lack of need for direct contact with other human beings and human communities. I am truly a &amp;quot;lone traveler&amp;quot; and have never belonged to my country, my home, my friend, or even my immediate family, with my whole heart; in the face of all these ties, I have never lost a sense of distance and a need for solitude—feelings which increase with the years. One becomes sharply aware, but without regret, of the limits of mutual understanding and consonance with other people. No doubt, such a person loses some of his innocence and unconcern; on the other hand, he is largely independent of the opinions, habits, and judgments of his fellows and avoids the temptation to build his inner equilibrium upon such insecure foundations.&lt;br /&gt;
&lt;br /&gt;
My political ideal is democracy. Let every man be respected as an individual and no man idolized. It is an irony of fate that I myself have been the recipient of excessive admiration and reverence from my fellow-beings, through no fault, and no merit, of my own. The cause of this may well be the desire, unattainable for many, to understand the few ideas to which I have with my feeble powers attained through ceaseless struggle. I have an unequivocal belief that the really valuable thing in the sense of achievement is not the political state but the creative, sentient individual, the personality; that it alone creates the noble and sublime, while the herd as such is dull in thought and dull in feeling.&lt;br /&gt;
&lt;br /&gt;
Speaking of the herd, I am notably referring to the worst of its manifestations, the military system, which I loathe. A person who can take pleasure in marching in rank and file to the strains of a band is beneath my contempt; he received his great brain by mistake—for him the spinal cord would have been amply sufficient. This plague spot of civilization ought to be abolished as soon as possible. Heroism on command, senseless violence, and all the loathsome nonsense that goes by the name of patriotism—how I hate them! War seems to me a mean, contemptible thing; I would rather be hacked in pieces than take part in such an abominable business. And yet, I still believe that, but for the pernicious influence of commercial and political interests which systematically corrupt the health of the people through schools and the press, the horror of war would have disappeared long ago.&lt;br /&gt;
&lt;br /&gt;
The most beautiful experience we can have is the mysterious. It is the fundamental emotion that stands at the cradle of true art and true science. Whoever does not know it and can no longer wonder, no longer marvel, is as good as dead, and his eyes are dimmed. It was the experience of mystery—even if mixed with fear—that engendered religion. A knowledge of the existence of something we cannot penetrate, of the manifestations of the profoundest reason and the most radiant beauty, which are only accessible to our reason in their most elementary forms—it is this knowledge and this emotion that constitute the truly religious attitude; in this sense, and only in this sense, I am a deeply religious man. I cannot conceive of a God who rewards and punishes his creatures, or has a will of the kind that we experience in ourselves. Neither can I nor would I want to conceive of an individual that survives his physical death; let feeble souls, from fear or absurd egoism, cherish such thoughts. I am satisfied with the mystery of the eternity of life and with the awareness and a glimpse of the marvelous structure of the existing world, together with the devoted striving to comprehend a portion, be it ever so tiny, of the Reason that manifests itself in nature.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 中文对照译文 ==&lt;br /&gt;
&lt;br /&gt;
* 许良英、赵中立、张宣三编译，选自商务印书馆《爱因斯坦文集》第三卷&lt;br /&gt;
&lt;br /&gt;
我们这些总有一死的人的命运是多么奇特呀！我们每个人在这个世界上都只作一个短暂的逗留；目的何在，却无所知，尽管有时自以为对此若有所感。但是，不必深思，只要从日常生活就可以明白：人是为别人而生存的——首先是为那样一些人，他们的喜悦和健康关系着我们自己的全部幸福；然后是为许多我们所不认识的人，他们的命运通过同情的纽带同我们密切结合在一起。我每天上百次地提醒自己：我的精神生活和物质生活都依靠着别人（包括生者和死者）的劳动，我必须尽力以同样的分量来报偿我所领受了的和至今还在领受着的东西。我强烈地向往着俭朴的生活，并且时常为发觉自己占用了同胞的过多劳动而难以忍受。我认为阶级的区分是不合理的，它最后所凭借的是以暴力为根据。我也相信，简单淳朴的生活，无论在身体上还是在精神上，对每个人都是有益的。&lt;br /&gt;
&lt;br /&gt;
我完全不相信人类会有那种在哲学意义上的自由。每一个人的行为，不仅受着外界的强迫，而且还要适应内心的必然。叔本华说：“人虽然能够做他所想做的，但不能要他所想要的。”这句话从我青年时代起，就对我是一个真正的启示；在我自己和别人生活面临困难的时候，它总是使我们得到安慰，并且永远是宽容的源泉。这种体会可以宽大为怀地减轻那种使人气馁的责任感，也可以防止我们过于严肃地对待自己和别人；它还导致一种特别给幽默以应有地位的人生观。&lt;br /&gt;
&lt;br /&gt;
要追究一个人自己或一切生物生存的意义或目的，从客观的观点看来，我总觉得是愚蠢可笑的。可是每个人都有一定的理想，这种理想决定着他的努力和判断的方向。就在这个意义上，我从来不把安逸和享乐看作是生活目的本身——这种伦理基础，我叫它猪栏的理想。照亮我的道路，并且不断地给我新的勇气去愉快地正视生活的理想，是真、善和美。要是没有志同道合者之间的亲切感情，要不是全神贯注于客观世界——那个在艺术和科学工作领域里永远达不到的对象，那么在我看来，生活就会是空虚的。人们所努力追求的庸俗的目标——财产、虚荣、奢侈的生活——我总觉得都是可鄙的。&lt;br /&gt;
&lt;br /&gt;
我对社会正义和社会责任的强烈感觉，同我显然的对别人和社会直接接触的淡漠，两者总是形成古怪的对照。我实在是一个“孤独的旅客”，我未曾全心全意地属于我的国家，我的家庭，我的朋友，甚至我最接近的亲人；在所有这些关系面前，我总是感觉到有一定距离并且需要保持孤独——而这种感受正与年俱增。人们会清楚地发觉，同别人的相互了解和协调一致是有限度的，但这不足惋惜。这样的人无疑有点失去他的天真无邪和无忧无虑的心境；但另一方面，他却能够在很大程度上不为别人的意见、习惯和判断所左右，并且能够不受诱惑要去把他的内心平衡在这样一些不可靠的基础之上。&lt;br /&gt;
&lt;br /&gt;
我的政治理想是民主主义。让每一个人都作为个人而受到尊重，而不让任何人成为崇拜的偶像。我自己受到了人们过分的赞扬和尊敬，这不是由于我自己的过错，也不是由于我自己的功劳，而实在是一种命运的嘲弄。其原因大概在于人们有一种愿望，想理解我以自己的微薄绵力通过不断的斗争所获得的少数几个观念，而这种愿望有很多人却未能实现。我完全明白，一个组织要实现它的目的，就必须有一个人去思考，去指挥，并且全面负担起责任来。但是被领导的人不应当受到压迫，他们必须有可能来选择自己的领袖。在我看来，强迫的专制制度很快就会腐化堕落。因为暴力所招引来的总是一些品德低劣的人，而且我相信，天才的暴君总是由无赖来继承，这是一条千古不易的规律。就是这个缘故，我总是强烈地反对今天我们在意大利和俄国所见到的那种制度。像欧洲今天所存在的情况，使得民主形式受到了怀疑，这不能归咎于民主原则本身，而是由于政府的不稳定和选举制度中与个人无关的特征。我相信美国在这方面已经找到了正确的道路。他们选出了一个任期足够长的总统，他有充分的权力来真正履行他的职责。另一方面，在德国的政治制度中，我所重视的是，它为救济患病或贫困的人作出了比较广泛的规定。在人生的丰富多彩的表演中，我觉得真正可贵的，不是政治上的国家，而是有创造性的、有感情的个人，是人格；只有个人才能创造出高尚的和卓越的东西，而群众本身在思想上总是迟钝的，在感觉上也总是迟钝的。&lt;br /&gt;
&lt;br /&gt;
讲到这里，我想起了群众生活中最坏的一种表现，那就是使我厌恶的军事制度。一个人能够洋洋得意地随着军乐队在四列纵队里行进，单凭这一点就足以使我对他轻视。他所以长了一个大脑，只是出于误会；单单一根脊髓就可满足他的全部需要了。文明国家的这种罪恶的渊薮，应当尽快加以消灭。由命令而产生的勇敢行为，毫无意义的暴行，以及在爱国主义名义下一切可恶的胡闹，所有这些都使我深恶痛绝！在我看来，战争是多么卑鄙、下流！我宁愿被千刀万剐，也不愿参预这种可憎的勾当。尽管如此，我对人类的评价还是十分高的，我相信，要是人民的健康感情没有被那些通过学校和报纸而起作用的商业利益和政治利益蓄意进行败坏，那么战争这个妖魔早就该绝迹了。&lt;br /&gt;
&lt;br /&gt;
我们所能有的最美好的经验是奥秘的经验。它是坚守在真正艺术和真正科学发源地上的基本感情。谁要是体验不到它，谁要是不再有好奇心也不再有惊讶的感觉，他就无异于行尸走肉，他的眼睛是迷糊不清的。就是这样奥秘的经验——虽然掺杂着恐怖——产生了宗教。我们认识到有某种为我们所不能洞察的东西存在，感觉到那种只能以其最原始的形式为我们感受到的最深奥的理性和最灿烂的美——正是这种认识和这种情感构成了真正的宗教感情；在这个意义上，而且也只是在这个意义上，我才是一个具有深挚的宗教感情的人。我无法想象一个会对自己的创造物加以赏罚的上帝，也无法想象它会有像在我们自己身上所体验到的那样一种意志。我不能也不愿去想象一个人在肉体死亡以后还会继续活着；让那些脆弱的灵魂，由于恐惧或者由于可笑的唯我论，去拿这种思想当宝贝吧！我自己只求满足于生命永恒的奥秘，满足于觉察现实世界的神奇的结构，窥见它的一鳞半爪，并且以诚挚的努力去领悟在自然界中显示出来的那个理性的一部分，即使只是其极小的一部分，我也就心满意足了。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 版本说明 ==&lt;br /&gt;
&lt;br /&gt;
| 项目 | 内容 |&lt;br /&gt;
|------|------|&lt;br /&gt;
| **标题** | What I Believe（《我的信仰》） |&lt;br /&gt;
| **德文标题** | Mein Glaubensbekenntnis |&lt;br /&gt;
| **写作时间** | 1930年夏天 |&lt;br /&gt;
| **写作地点** | 柏林郊外卡普特（Caputh）消夏小屋 |&lt;br /&gt;
| **首次发表** | 《论坛与世纪》（*Forum and Century*）第84卷，193-194页，1930年10月 |&lt;br /&gt;
| **手稿编号** | 耶路撒冷希伯来大学爱因斯坦档案馆 [29-028] |&lt;br /&gt;
&lt;br /&gt;
该文也以《我的世界观》（*The World As I See It* / *Mein Weltbild*）为题收录于爱因斯坦的多部文集中。文中引用的叔本华格言“人虽然能够做他所想做的，但不能要他所想要的”是理解爱因斯坦人生观的关键线索。&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6216</id>
		<title>What-i-believe-Einstein</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=What-i-believe-Einstein&amp;diff=6216"/>
		<updated>2026-06-02T03:05:17Z</updated>

		<summary type="html">&lt;p&gt;Zhli：建立内容为“以下是爱因斯坦 **《我的信仰》（What I Believe）** 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（*Forum and Century…”的新页面&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;以下是爱因斯坦 **《我的信仰》（What I Believe）** 的原文。该文写于1930年夏天，最初发表于《论坛与世纪》（*Forum and Century*）杂志第84卷。&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
## 英文原文&lt;br /&gt;
&lt;br /&gt;
**What I Believe**&lt;br /&gt;
*By Albert Einstein*&lt;br /&gt;
&lt;br /&gt;
How strange is the lot of us mortals! Each of us is here for a brief sojourn; for what purpose he knows not, though he sometimes thinks he senses it. But without deeper reflection one knows from daily life that one exists for other people—first of all for those upon whose smiles and well-being our own happiness is wholly dependent, and then for the many, unknown to us, to whose destinies we are bound by the ties of sympathy. A hundred times every day I remind myself that my inner and outer life are based on the labors of other men, living and dead, and that I must exert myself in order to give in the same measure as I have received and am still receiving. I am strongly drawn to a frugal life and am often oppressively aware that I am engrossing an undue amount of the labor of my fellow-men. I regard class distinctions as unjustified and, in the last resort, based on force. I also believe that a simple and unassuming life is good for everybody, physically and mentally.&lt;br /&gt;
&lt;br /&gt;
I do not at all believe in human freedom in the philosophical sense. Everybody acts not only under external compulsion but also in accordance with inner necessity. Schopenhauer's saying, &amp;quot;A man can do what he wants, but not want what he wants,&amp;quot; has been a very real inspiration to me since my youth; it has been a continual consolation in the face of life's hardships, my own and others', and an unfailing well-spring of tolerance. This realization mercifully mitigates the easily paralyzing sense of responsibility and prevents us from taking ourselves and other people all too seriously; it is conducive to a view of life which, in particular, gives humor its due.&lt;br /&gt;
&lt;br /&gt;
To inquire after the meaning or object of one's own existence or that of all creatures has always seemed to me absurd from an objective point of view. And yet everybody has certain ideals which determine the direction of his endeavors and his judgments. In this sense I have never looked upon ease and happiness as ends in themselves—this ethical basis I call the ideal of a pigsty. The ideals which have lighted my way, and time after time have given me new courage to face life cheerfully, have been Kindness, Beauty, and Truth. Without the sense of kinship with men of like mind, without the occupation with the objective world, the eternally unattainable in the field of art and scientific endeavors, life would have seemed to me empty. The trite objects of human efforts—possessions, outward success, luxury—have always seemed to me contemptible.&lt;br /&gt;
&lt;br /&gt;
My passionate sense of social justice and social responsibility has always contrasted oddly with my pronounced lack of need for direct contact with other human beings and human communities. I am truly a &amp;quot;lone traveler&amp;quot; and have never belonged to my country, my home, my friend, or even my immediate family, with my whole heart; in the face of all these ties, I have never lost a sense of distance and a need for solitude—feelings which increase with the years. One becomes sharply aware, but without regret, of the limits of mutual understanding and consonance with other people. No doubt, such a person loses some of his innocence and unconcern; on the other hand, he is largely independent of the opinions, habits, and judgments of his fellows and avoids the temptation to build his inner equilibrium upon such insecure foundations.&lt;br /&gt;
&lt;br /&gt;
My political ideal is democracy. Let every man be respected as an individual and no man idolized. It is an irony of fate that I myself have been the recipient of excessive admiration and reverence from my fellow-beings, through no fault, and no merit, of my own. The cause of this may well be the desire, unattainable for many, to understand the few ideas to which I have with my feeble powers attained through ceaseless struggle. I have an unequivocal belief that the really valuable thing in the sense of achievement is not the political state but the creative, sentient individual, the personality; that it alone creates the noble and sublime, while the herd as such is dull in thought and dull in feeling.&lt;br /&gt;
&lt;br /&gt;
Speaking of the herd, I am notably referring to the worst of its manifestations, the military system, which I loathe. A person who can take pleasure in marching in rank and file to the strains of a band is beneath my contempt; he received his great brain by mistake—for him the spinal cord would have been amply sufficient. This plague spot of civilization ought to be abolished as soon as possible. Heroism on command, senseless violence, and all the loathsome nonsense that goes by the name of patriotism—how I hate them! War seems to me a mean, contemptible thing; I would rather be hacked in pieces than take part in such an abominable business. And yet, I still believe that, but for the pernicious influence of commercial and political interests which systematically corrupt the health of the people through schools and the press, the horror of war would have disappeared long ago.&lt;br /&gt;
&lt;br /&gt;
The most beautiful experience we can have is the mysterious. It is the fundamental emotion that stands at the cradle of true art and true science. Whoever does not know it and can no longer wonder, no longer marvel, is as good as dead, and his eyes are dimmed. It was the experience of mystery—even if mixed with fear—that engendered religion. A knowledge of the existence of something we cannot penetrate, of the manifestations of the profoundest reason and the most radiant beauty, which are only accessible to our reason in their most elementary forms—it is this knowledge and this emotion that constitute the truly religious attitude; in this sense, and only in this sense, I am a deeply religious man. I cannot conceive of a God who rewards and punishes his creatures, or has a will of the kind that we experience in ourselves. Neither can I nor would I want to conceive of an individual that survives his physical death; let feeble souls, from fear or absurd egoism, cherish such thoughts. I am satisfied with the mystery of the eternity of life and with the awareness and a glimpse of the marvelous structure of the existing world, together with the devoted striving to comprehend a portion, be it ever so tiny, of the Reason that manifests itself in nature.&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
## 中文对照译文&lt;br /&gt;
&lt;br /&gt;
（许良英、赵中立、张宣三编译，选自商务印书馆《爱因斯坦文集》第三卷）&lt;br /&gt;
&lt;br /&gt;
我们这些总有一死的人的命运是多么奇特呀！我们每个人在这个世界上都只作一个短暂的逗留；目的何在，却无所知，尽管有时自以为对此若有所感。但是，不必深思，只要从日常生活就可以明白：人是为别人而生存的——首先是为那样一些人，他们的喜悦和健康关系着我们自己的全部幸福；然后是为许多我们所不认识的人，他们的命运通过同情的纽带同我们密切结合在一起。我每天上百次地提醒自己：我的精神生活和物质生活都依靠着别人（包括生者和死者）的劳动，我必须尽力以同样的分量来报偿我所领受了的和至今还在领受着的东西。我强烈地向往着俭朴的生活，并且时常为发觉自己占用了同胞的过多劳动而难以忍受。我认为阶级的区分是不合理的，它最后所凭借的是以暴力为根据。我也相信，简单淳朴的生活，无论在身体上还是在精神上，对每个人都是有益的。&lt;br /&gt;
&lt;br /&gt;
我完全不相信人类会有那种在哲学意义上的自由。每一个人的行为，不仅受着外界的强迫，而且还要适应内心的必然。叔本华说：“人虽然能够做他所想做的，但不能要他所想要的。”这句话从我青年时代起，就对我是一个真正的启示；在我自己和别人生活面临困难的时候，它总是使我们得到安慰，并且永远是宽容的源泉。这种体会可以宽大为怀地减轻那种使人气馁的责任感，也可以防止我们过于严肃地对待自己和别人；它还导致一种特别给幽默以应有地位的人生观。&lt;br /&gt;
&lt;br /&gt;
要追究一个人自己或一切生物生存的意义或目的，从客观的观点看来，我总觉得是愚蠢可笑的。可是每个人都有一定的理想，这种理想决定着他的努力和判断的方向。就在这个意义上，我从来不把安逸和享乐看作是生活目的本身——这种伦理基础，我叫它猪栏的理想。照亮我的道路，并且不断地给我新的勇气去愉快地正视生活的理想，是真、善和美。要是没有志同道合者之间的亲切感情，要不是全神贯注于客观世界——那个在艺术和科学工作领域里永远达不到的对象，那么在我看来，生活就会是空虚的。人们所努力追求的庸俗的目标——财产、虚荣、奢侈的生活——我总觉得都是可鄙的。&lt;br /&gt;
&lt;br /&gt;
我对社会正义和社会责任的强烈感觉，同我显然的对别人和社会直接接触的淡漠，两者总是形成古怪的对照。我实在是一个“孤独的旅客”，我未曾全心全意地属于我的国家，我的家庭，我的朋友，甚至我最接近的亲人；在所有这些关系面前，我总是感觉到有一定距离并且需要保持孤独——而这种感受正与年俱增。人们会清楚地发觉，同别人的相互了解和协调一致是有限度的，但这不足惋惜。这样的人无疑有点失去他的天真无邪和无忧无虑的心境；但另一方面，他却能够在很大程度上不为别人的意见、习惯和判断所左右，并且能够不受诱惑要去把他的内心平衡在这样一些不可靠的基础之上。&lt;br /&gt;
&lt;br /&gt;
我的政治理想是民主主义。让每一个人都作为个人而受到尊重，而不让任何人成为崇拜的偶像。我自己受到了人们过分的赞扬和尊敬，这不是由于我自己的过错，也不是由于我自己的功劳，而实在是一种命运的嘲弄。其原因大概在于人们有一种愿望，想理解我以自己的微薄绵力通过不断的斗争所获得的少数几个观念，而这种愿望有很多人却未能实现。我完全明白，一个组织要实现它的目的，就必须有一个人去思考，去指挥，并且全面负担起责任来。但是被领导的人不应当受到压迫，他们必须有可能来选择自己的领袖。在我看来，强迫的专制制度很快就会腐化堕落。因为暴力所招引来的总是一些品德低劣的人，而且我相信，天才的暴君总是由无赖来继承，这是一条千古不易的规律。就是这个缘故，我总是强烈地反对今天我们在意大利和俄国所见到的那种制度。像欧洲今天所存在的情况，使得民主形式受到了怀疑，这不能归咎于民主原则本身，而是由于政府的不稳定和选举制度中与个人无关的特征。我相信美国在这方面已经找到了正确的道路。他们选出了一个任期足够长的总统，他有充分的权力来真正履行他的职责。另一方面，在德国的政治制度中，我所重视的是，它为救济患病或贫困的人作出了比较广泛的规定。在人生的丰富多彩的表演中，我觉得真正可贵的，不是政治上的国家，而是有创造性的、有感情的个人，是人格；只有个人才能创造出高尚的和卓越的东西，而群众本身在思想上总是迟钝的，在感觉上也总是迟钝的。&lt;br /&gt;
&lt;br /&gt;
讲到这里，我想起了群众生活中最坏的一种表现，那就是使我厌恶的军事制度。一个人能够洋洋得意地随着军乐队在四列纵队里行进，单凭这一点就足以使我对他轻视。他所以长了一个大脑，只是出于误会；单单一根脊髓就可满足他的全部需要了。文明国家的这种罪恶的渊薮，应当尽快加以消灭。由命令而产生的勇敢行为，毫无意义的暴行，以及在爱国主义名义下一切可恶的胡闹，所有这些都使我深恶痛绝！在我看来，战争是多么卑鄙、下流！我宁愿被千刀万剐，也不愿参预这种可憎的勾当。尽管如此，我对人类的评价还是十分高的，我相信，要是人民的健康感情没有被那些通过学校和报纸而起作用的商业利益和政治利益蓄意进行败坏，那么战争这个妖魔早就该绝迹了。&lt;br /&gt;
&lt;br /&gt;
我们所能有的最美好的经验是奥秘的经验。它是坚守在真正艺术和真正科学发源地上的基本感情。谁要是体验不到它，谁要是不再有好奇心也不再有惊讶的感觉，他就无异于行尸走肉，他的眼睛是迷糊不清的。就是这样奥秘的经验——虽然掺杂着恐怖——产生了宗教。我们认识到有某种为我们所不能洞察的东西存在，感觉到那种只能以其最原始的形式为我们感受到的最深奥的理性和最灿烂的美——正是这种认识和这种情感构成了真正的宗教感情；在这个意义上，而且也只是在这个意义上，我才是一个具有深挚的宗教感情的人。我无法想象一个会对自己的创造物加以赏罚的上帝，也无法想象它会有像在我们自己身上所体验到的那样一种意志。我不能也不愿去想象一个人在肉体死亡以后还会继续活着；让那些脆弱的灵魂，由于恐惧或者由于可笑的唯我论，去拿这种思想当宝贝吧！我自己只求满足于生命永恒的奥秘，满足于觉察现实世界的神奇的结构，窥见它的一鳞半爪，并且以诚挚的努力去领悟在自然界中显示出来的那个理性的一部分，即使只是其极小的一部分，我也就心满意足了。&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
## 版本说明&lt;br /&gt;
&lt;br /&gt;
| 项目 | 内容 |&lt;br /&gt;
|------|------|&lt;br /&gt;
| **标题** | What I Believe（《我的信仰》） |&lt;br /&gt;
| **德文标题** | Mein Glaubensbekenntnis |&lt;br /&gt;
| **写作时间** | 1930年夏天 |&lt;br /&gt;
| **写作地点** | 柏林郊外卡普特（Caputh）消夏小屋 |&lt;br /&gt;
| **首次发表** | 《论坛与世纪》（*Forum and Century*）第84卷，193-194页，1930年10月 |&lt;br /&gt;
| **手稿编号** | 耶路撒冷希伯来大学爱因斯坦档案馆 [29-028] |&lt;br /&gt;
&lt;br /&gt;
该文也以《我的世界观》（*The World As I See It* / *Mein Weltbild*）为题收录于爱因斯坦的多部文集中。文中引用的叔本华格言“人虽然能够做他所想做的，但不能要他所想要的”是理解爱因斯坦人生观的关键线索。&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6215</id>
		<title>Linux-2026-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Linux-2026-fall&amp;diff=6215"/>
		<updated>2026-05-25T06:58:50Z</updated>

		<summary type="html">&lt;p&gt;Zhli：建立内容为“== 课程安排 == * 老师: [http://web.suda.edu.cn/zhli13/ 李正华] * 助教：xx * 计24计科1班,计24计科2班（大三上） * 专业选修课 * 上课…”的新页面&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== 课程安排 ==&lt;br /&gt;
* 老师: [http://web.suda.edu.cn/zhli13/ 李正华]&lt;br /&gt;
* 助教：xx&lt;br /&gt;
* 计24计科1班,计24计科2班（大三上）&lt;br /&gt;
* 专业选修课&lt;br /&gt;
* 上课时间和地点&lt;br /&gt;
** 理论课：周一 6-7节 14:00-15:35 逸夫楼334  【1-17周】&lt;br /&gt;
** 实践课：周三 1-2节 8:00-9:35 理工楼243 【单周】&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Zhenghua-english-study&amp;diff=6213</id>
		<title>Zhenghua-english-study</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Zhenghua-english-study&amp;diff=6213"/>
		<updated>2026-04-19T13:01:17Z</updated>

		<summary type="html">&lt;p&gt;Zhli：建立内容为“ &amp;lt;nowiki&amp;gt; 知乎上的一个问题：中国人有哪些常念错的英语单词？  我不认识的单词，或者我读错的【2026-04】 1. Coupon n. 优惠券…”的新页面&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt; &amp;lt;nowiki&amp;gt;&lt;br /&gt;
知乎上的一个问题：中国人有哪些常念错的英语单词？&lt;br /&gt;
&lt;br /&gt;
我不认识的单词，或者我读错的【2026-04】&lt;br /&gt;
1. Coupon n. 优惠券 - 正确读音：/ˈkuːpɒn/&lt;br /&gt;
2. Debris n. 碎片，残骸 - 正确读音：/ˈdeɪbriː/ 或 /ˈdebriː/&lt;br /&gt;
3. Heir n. 继承人 - 正确读音：/eə/&lt;br /&gt;
5. Receipt n. 收据 - 正确读音：/rɪˈsiːt/&lt;br /&gt;
6. Debut n. 首次亮相 - 正确读音：/ˈdeɪbjuː/ 或 /ˈdebjuː/&lt;br /&gt;
7. Caveat n. 警告，告诫 - 正确读音：/ˈkæviæt/&lt;br /&gt;
8. Salmon n. 三文鱼；鲑鱼 - 正确读音：/ˈsæmən/&lt;br /&gt;
10. Café n. 咖啡馆 - 正确读音：/ˈkæfeɪ/&lt;br /&gt;
15. Epitome n. 缩影，典范 - 正确读音：/ɪˈpɪtəmi/&lt;br /&gt;
16. Certificate n. 证书 - 正确读音：/səˈtɪfɪkət/&lt;br /&gt;
18. Facade n. 正面；表面；立面 - 正确读音：/fəˈsɑːd/&lt;br /&gt;
19. Albeit conj. 虽然 - 正确读音：/ɔːlˈbiːɪt/&lt;br /&gt;
20. Greenwich n. 格林威治 - 正确读音：/ˈɡrenɪtʃ/ 或 /ˈɡrenɪdʒ/&lt;br /&gt;
22. Indictment n. 起诉书；谴责 - 正确读音：/ɪnˈdaɪtmənt/   【Indict v. 起诉 - 正确读音：/ɪnˈdaɪt/】&lt;br /&gt;
23. Gif n. 动图格式 - 正确读音：/dʒɪf/&lt;br /&gt;
24. Recipe n. 食谱，配方 - 正确读音：/ˈresəpi/ &lt;br /&gt;
25. Cupboard n. 橱柜 - 正确读音：/ˈkʌbəd/&lt;br /&gt;
27. Pedagogy n. 教学法 - 正确读音：/ˈpedəɡɒdʒi/&lt;br /&gt;
28. Hegemony n. 霸权 - 正确读音：/hɪˈdʒeməni/ 或 /ˈhedʒɪməni/&lt;br /&gt;
29. Chassis n. 底盘 - 正确读音：/ˈʃæsi/&lt;br /&gt;
32. Ostrich n. 鸵鸟 - 正确读音：/ˈɒstrɪtʃ/&lt;br /&gt;
33. Cache n. 隐藏所；缓存 - 正确读音：/kæʃ/ 【我一直读tʃ】&lt;br /&gt;
34. Photography n. 摄影 - 正确读音：/fəˈtɒɡrəfi/ 【我跟小孩读绘本、学会的】&lt;br /&gt;
35. Cation n. 阳离子 - 正确读音：/ˈkætaɪən/&lt;br /&gt;
37. Rapport n. 融洽关系 - 正确读音：/ræˈpɔː/ 【感觉是法语来的】&lt;br /&gt;
39. Entrepreneur n. 企业家 - 正确读音：/ˌɒntrəprəˈnɜː/ 【听 VOA 学会的】&lt;br /&gt;
41. Dessert n. 甜点 - 正确读音：/dɪˈzɜːt/ 【沙漠 desert】&lt;br /&gt;
43. Process n. 过程；v. 处理 - 正确读音：/ˈprəʊses/（名词和动词均此读音） 【重音一直读错，不应该，美式发ɑː】&lt;br /&gt;
44. Cliché n. 陈词滥调 - 正确读音：/kliːˈʃeɪ/ 或 /ˈkliːʃeɪ/ &lt;br /&gt;
46. Mischievous adj. 淘气的 - 正确读音：/ˈmɪstʃɪvəs/ 的【重音在最前面】&lt;br /&gt;
47. Et cetera (etc.) 等等 - 正确读音：/ɪt ˈsetərə/ 或 /ˌet ˈsetərə/ 【这个会】&lt;br /&gt;
48. Niagara n. 尼亚加拉 - 正确读音：/naɪˈæɡərə/&lt;br /&gt;
49. Draught n. 穿堂风；气流 - 正确读音：/drɑːft/ 或 /dræft/&lt;br /&gt;
50. Genre n. 类型；体裁 - 正确读音：/ˈʒɒnrə/ 或 /ˈʒɑːnrə/ 【这个会】&lt;br /&gt;
&lt;br /&gt;
Debt [dɛt] : 债务&lt;br /&gt;
Receipt [rɪ'sit] : 收据&lt;br /&gt;
Suite [swit] : 套房&lt;br /&gt;
&lt;br /&gt;
clothes / kloʊðz /&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6209</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6209"/>
		<updated>2026-03-19T08:02:32Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 作业1：分字（C++语言） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：【2003 年发布的RFC 3629标准中，已经废除了 5-6 个字节，所以只用考虑 1-4 个字节的情况。感谢曹诗伟同学指出错误。】&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 6 周下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 10 周下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 12 周之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第14 周下课之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
* 作业提交时间截止时间：第16 周下课之前提交&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6208</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6208"/>
		<updated>2026-03-19T07:45:43Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 具体作业 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 6 周下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 10 周下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第 12 周之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第14 周下课之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
* 作业提交时间截止时间：第16 周下课之前提交&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6207</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6207"/>
		<updated>2026-03-19T07:42:57Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 具体作业 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第4周下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6206</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6206"/>
		<updated>2026-03-19T06:29:59Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 计算成绩的规则和说明（待定） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、平时考核为主）&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;平时考核：考察课程相关的基础知识，看看作业是否是自己做的&amp;lt;/font&amp;gt;&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6205</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6205"/>
		<updated>2026-03-19T06:29:06Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 计算成绩的规则和说明（待定） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、考核为主）&lt;br /&gt;
*** 考核：考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到网站（见下面）中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6204</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6204"/>
		<updated>2026-03-19T06:28:39Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 计算成绩的规则和说明（待定） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、考核为主）&lt;br /&gt;
*** 考核：考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到如上网站中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 签到表：除了姓名，还要写一下进展&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6203</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6203"/>
		<updated>2026-03-19T06:27:40Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 计算成绩的规则和说明（待定） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70分&lt;br /&gt;
** 一系列作业，每个作业 5-15分（形式检查为辅、考核为主）&lt;br /&gt;
*** 考核：考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到如上网站中&lt;br /&gt;
* 平时成绩：30分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6201</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6201"/>
		<updated>2026-03-12T06:54:40Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 具体课程（含作业） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70-80分&lt;br /&gt;
** 一系列作业，每个作业10-20分（形式检查为辅、考核为主）&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到csteaching&lt;br /&gt;
&lt;br /&gt;
* 期末面对面小测验：10分&lt;br /&gt;
** 考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
&lt;br /&gt;
* 平时成绩：10-20分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体内容（含作业：平时：30 分；实验：70 分） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6200</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6200"/>
		<updated>2026-03-12T06:30:52Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 具体课程（含作业） */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70-80分&lt;br /&gt;
** 一系列作业，每个作业10-20分（形式检查为辅、考核为主）&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到csteaching&lt;br /&gt;
&lt;br /&gt;
* 期末面对面小测验：10分&lt;br /&gt;
** 考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
&lt;br /&gt;
* 平时成绩：10-20分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体课程（含作业） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 15%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 15% &lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6199</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6199"/>
		<updated>2026-03-11T01:28:29Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* 中文电商评论文本噪声纠正数据集&lt;br /&gt;
** [[:文件:Review42k.txt|下载网址]]&lt;br /&gt;
* 中文电商评论翻译噪声标注数据集&lt;br /&gt;
** [[:文件:review_annote_error_data.jsonl.zip|下载网址]]&lt;br /&gt;
* 中英翻译噪声标注数据集&lt;br /&gt;
** [[:文件:iwslt_fixed_data.jsonl.zip|下载网址]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6198</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6198"/>
		<updated>2026-03-11T01:28:06Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* 中文电商评论文本噪声纠正数据集&lt;br /&gt;
** [[文件:Review42k.txt]]&lt;br /&gt;
* 中文电商评论翻译噪声标注数据集&lt;br /&gt;
** [[:文件:review_annote_error_data.jsonl.zip|||下载网址]]&lt;br /&gt;
* 中英翻译噪声标注数据集&lt;br /&gt;
** [[文件:iwslt_fixed_data.jsonl.zip]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6197</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6197"/>
		<updated>2026-03-11T01:25:52Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* 中文电商评论文本噪声纠正数据集&lt;br /&gt;
** [[文件:Review42k.txt]]&lt;br /&gt;
* 中文电商评论翻译噪声标注数据集&lt;br /&gt;
** [[文件:review_annote_error_data.jsonl.zip|||下载网址]]&lt;br /&gt;
* 中英翻译噪声标注数据集&lt;br /&gt;
** [[文件:iwslt_fixed_data.jsonl.zip]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6196</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6196"/>
		<updated>2026-03-11T01:25:40Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* 中文电商评论文本噪声纠正数据集&lt;br /&gt;
** [[文件:Review42k.txt]]&lt;br /&gt;
* 中文电商评论翻译噪声标注数据集&lt;br /&gt;
** [[文件:review_annote_error_data.jsonl.zip|下载网址]]&lt;br /&gt;
* 中英翻译噪声标注数据集&lt;br /&gt;
** [[文件:iwslt_fixed_data.jsonl.zip]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Review_annote_error_data.jsonl.zip&amp;diff=6195</id>
		<title>文件:Review annote error data.jsonl.zip</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Review_annote_error_data.jsonl.zip&amp;diff=6195"/>
		<updated>2026-03-11T01:25:23Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6194</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6194"/>
		<updated>2026-03-11T01:24:25Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* 中文电商评论文本噪声纠正数据集&lt;br /&gt;
** [[文件:Review42k.txt]]&lt;br /&gt;
* 中文电商评论翻译噪声标注数据集&lt;br /&gt;
** [[文件:review_annote_error_data.jsonl.zip]]&lt;br /&gt;
* 中英翻译噪声标注数据集&lt;br /&gt;
** [[文件:iwslt_fixed_data.jsonl.zip]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Iwslt_fixed_data.jsonl.zip&amp;diff=6193</id>
		<title>文件:Iwslt fixed data.jsonl.zip</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Iwslt_fixed_data.jsonl.zip&amp;diff=6193"/>
		<updated>2026-03-11T01:22:47Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6192</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6192"/>
		<updated>2026-03-11T01:21:57Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;br /&gt;
* &lt;br /&gt;
** [[文件:Review42k.txt]]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6191</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6191"/>
		<updated>2026-03-11T01:19:35Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译)开放数据集 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
** [https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 下载网址]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6190</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6190"/>
		<updated>2026-03-11T01:19:17Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译) */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译)开放数据集 ==&lt;br /&gt;
&lt;br /&gt;
* 中英篇章翻译词汇一致性评测数据集&lt;br /&gt;
&lt;br /&gt;
[https://github.com/577521/Evaluation-Dataset-for-Lexical-Translation-Consistency 网址]&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Review42k.txt&amp;diff=6189</id>
		<title>文件:Review42k.txt</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Review42k.txt&amp;diff=6189"/>
		<updated>2026-03-11T01:18:22Z</updated>

		<summary type="html">&lt;p&gt;Zhli：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6188</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6188"/>
		<updated>2026-03-10T02:36:21Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 提交作业说明 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70-80分&lt;br /&gt;
** 一系列作业，每个作业10-20分（形式检查为辅、考核为主）&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到csteaching&lt;br /&gt;
&lt;br /&gt;
* 期末面对面小测验：10分&lt;br /&gt;
** 考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
&lt;br /&gt;
* 平时成绩：10-20分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 作业网址：本学期开始的实验布置、提交与批改等不再使用csteaching平台，统一改用工程认证管理系统。请各位老师通过工程认证管理系统（网址[http://42.244.43.76:8000/ http://42.244.43.76:8000/]）开展实验布置、批改等相关工作，并烦请同步通知班级学生在该系统完成实验提交。&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体课程（含作业） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 10%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 20%【比例低一点】&lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6187</id>
		<title>Projects</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Projects&amp;diff=6187"/>
		<updated>2026-03-09T07:39:07Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* MT(机器翻译) */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Suda-HLT主要项目 &lt;br /&gt;
&lt;br /&gt;
== LAGroup（语言分析小组） ==&lt;br /&gt;
&lt;br /&gt;
  作为自然语言处理基础研究，苏州大学自然语言分析技术的目标是精准分析句子的词法和句法信息，以支持各种应用需求。我们的技术主要有几个特点：1）采用目前行业领先的多种机器学习技术，包括传统的基于离散特征的方法和深度学习方法，以提高分析性能，同时兼顾效率；2）基于我们做出的面向多源异构数据融合的一系列工作，充分利用现有的各种人工标注数据，提高模型的分析能；3）采用我们提出的基于局部标注表示的统一框架，允许训练数据只包含局部标注信息，从而充分利用各种弱标注数据，也可以将先验知识转化为弱标注信息，从而对模型解码过程进行直接约束；4）我们不断针对多源网络文本，进行人工标注，不断增加高质量训练数据。&lt;br /&gt;
&lt;br /&gt;
 基于以上技术，我们搭建了一个稳定、高准确率、高效率的[http://hlt-la.suda.edu.cn/ 汉语理解平台]，从而实现技术不断积累和沉淀，目前已经向阿里、科沃斯、狗尾草等公司提供服务。同时，为了支持人工数据标注工作，我们也搭建了一个139X224X234X18/anno-sys 数据标注平台，采用局部标注、严格双人标注、专家审核等形式，我们发现可以最大限度降低数据标注管理者的工作，同时也可以在降低人力成本和提高数据质量之间获得平衡。&lt;br /&gt;
&lt;br /&gt;
* 汉语开放依存树库构建：[http://hlt.suda.edu.cn/index.php/CODT CODT]&lt;br /&gt;
* 词语关系网络构建（目前关注上下位关系）&lt;br /&gt;
&lt;br /&gt;
== KG(知识图谱) ==&lt;br /&gt;
* 情感知识构建&lt;br /&gt;
 * 中文实体情感知识库 [[SentiBridge]]&lt;br /&gt;
 * 电商情感词典[[ECSD]]&lt;br /&gt;
&lt;br /&gt;
* 知识图谱构建&lt;br /&gt;
 * 人物关系标注数据集：IPRE，下载地址=https://github.com/SUDA-HLT/IPRE&lt;br /&gt;
 * 实体关系标注数据集：NYT-H，在NYT远程监督数据基础上，人工对测试集进行标注，可实现准确评价，下载地址=https://github.com/Spico197/NYT-H&lt;br /&gt;
&lt;br /&gt;
== MT(机器翻译) ==&lt;br /&gt;
&lt;br /&gt;
* 名称 mt1.json&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6186</id>
		<title>Writing-2025-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6186"/>
		<updated>2026-03-09T00:29:48Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 考试成绩 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= 专业写作（学硕、博士）	李正华	=&lt;br /&gt;
&lt;br /&gt;
* 学生：2025博士2025硕士	&lt;br /&gt;
* 助教：周月驰&lt;br /&gt;
* 时间：星期三	6-8 14:00-16:40	(从第三周开始上课)  14:45休息5分钟；15:35休息20分钟（实际会休息5分钟）&lt;br /&gt;
* 地点：理工楼153&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 &lt;br /&gt;
8	15:55-16:40 【15:40第三节课，通常16:25下课】&lt;br /&gt;
9	16:45-17:30&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 计划教学大纲 =&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-syllabus.png|&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 课程考核 =&lt;br /&gt;
课程考核分为两部分，闭卷考试和课上报告。&lt;br /&gt;
== 闭卷考试 ==&lt;br /&gt;
请大家提前预留时间参与考试！&lt;br /&gt;
&lt;br /&gt;
* 考试时间：12.25 14:00~15:30&lt;br /&gt;
* 考试地点：学号前20人在理工楼635，其余同学在理工楼103&lt;br /&gt;
* 考试内容：&lt;br /&gt;
** 2～3篇论文（课上同学讲的报告）&lt;br /&gt;
** 公众号《专业写作》系列文章（翻转课堂）&lt;br /&gt;
** 课上读过的论文（Transformer，ELMo，BERT，GPT，CLIP，ViT）&lt;br /&gt;
** 约7道题，每题200～300字，用自己的话来讲。&lt;br /&gt;
&lt;br /&gt;
* 考试要求：带两张A4纸，黑笔。诚信考试！&lt;br /&gt;
&lt;br /&gt;
== 课上报告 ==&lt;br /&gt;
未当堂汇报的同学需离线录制 8-12分钟 的视频报告（推荐使用腾讯会议录屏）。&lt;br /&gt;
&lt;br /&gt;
*   报告要求：同当堂汇报。&lt;br /&gt;
*   截止时间：北京时间 2025.12.31 23:59&lt;br /&gt;
*   提交格式：请提交一个 ZIP 压缩包，压缩包需命名为学号-姓名（例如：20254027007-周月驰.zip）。压缩包内文件结构如下：&lt;br /&gt;
    20254027007-周月驰&lt;br /&gt;
    ├── xx.mp4  (视频需 &amp;lt;30MB)&lt;br /&gt;
    ├── xx.pptx (汇报PPT)&lt;br /&gt;
    └── xx.docx (补充文档)&lt;br /&gt;
    (注：不需要提交论文原文了)&lt;br /&gt;
* 提交方式：压缩后发送助教邮箱 20254027007@stu.suda.edu.cn&lt;br /&gt;
&lt;br /&gt;
== 考试成绩 ==&lt;br /&gt;
* 李正华老师 2025 秋《专业写作课》成绩，请在课程主页上查看&lt;br /&gt;
* 如果确实觉得有问题，可以在3 月 9 日 17:00 前给助教发邮件，申请复查；但是如果复查后没有问题，可能要从严批阅，导致降分（5 分）&lt;br /&gt;
* 点击图片放大查看&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-all-scores.png&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 上课板书 =&lt;br /&gt;
== 2025.12.16 Lesson 13 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course13-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写title, abstract, and conclusion.&lt;br /&gt;
* 重读ViT的related work和方法。&lt;br /&gt;
* 舒仁义和李梦华同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.10 Lesson 12 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course12-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写related work.&lt;br /&gt;
* 重读CLIP的方法，读ViT的摘要和引言。&lt;br /&gt;
* 李传伟和姚昱同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.03 Lesson 11 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course11-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写introduction.&lt;br /&gt;
* 重读CLIP的引言，发现了很多可以改进的写作上的点。&lt;br /&gt;
* 邓皓文同学讲HS-DCell。&lt;br /&gt;
&lt;br /&gt;
== 2025.11.26 Lesson 10 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course10-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写experiments部分，分享人生感悟。&lt;br /&gt;
* 带读CLIP的方法部分。&lt;br /&gt;
* 孙家扬同学讲ViT。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 2025.11.19 Lesson 9 ==&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写method部分&lt;br /&gt;
* 带读CLIP的intro和related work&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌、杨文瑞四位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.12 Lesson 8 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course8-image2.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做实验&lt;br /&gt;
* 阅读CLIP的abstract和部分intro&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌三位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.5 Lesson 7 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course7-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何想idea&lt;br /&gt;
* 读完BERT&lt;br /&gt;
* 余田田、梁靖松分别讲FairGNN和有关药物生成的工作&lt;br /&gt;
&lt;br /&gt;
== 2025.10.29 Lesson 6 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course6-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写论文笔记&lt;br /&gt;
* 重读GPT，带读BERT摘要、引言&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; &lt;br /&gt;
GPT 的 finetune，针对一个具体任务&lt;br /&gt;
只能做分类任务 sentence-level 的任务&lt;br /&gt;
对于问答这样的任务（traversal-style 方式）：question &amp;lt;sep&amp;gt; answer GPT 编码后，最后一个位置的 hidden，经过 MLP，打分。4 个候选 answer（traversal-style)，softmax，最大化正确的 answer 的概率。&lt;br /&gt;
和之后的大一统的 prompt-based 的方法相比，不是一回事。&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
* 余田田、陈果、ruitong分别讲FairGNN、CLIP、LLaMA&lt;br /&gt;
&lt;br /&gt;
== 2025.10.22 Lesson 5 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course5-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何选论文、如何读论文&lt;br /&gt;
* 带读GPT技术报告&lt;br /&gt;
* 崔青青、许欣芸、吕喆分别讲图、AdaLora、DPO&lt;br /&gt;
&lt;br /&gt;
== 2025.10.15 Lesson 4 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course4-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨什么是一个完整的科研经历&lt;br /&gt;
* 带读elmo方法部分&lt;br /&gt;
* yanhui 讲eswa有关数据集的工作，罗小城和崔青青分别讲softthinking和正则图&lt;br /&gt;
&lt;br /&gt;
== 2025.10.11 Lesson 3 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course3-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做报告&lt;br /&gt;
* 带读elmo摘要、引言、相关工作&lt;br /&gt;
* shilin 和 ziheng 讲报告，分别介绍copyne和大小模型协同的csc&lt;br /&gt;
&lt;br /&gt;
== 2025.09.24 Lesson 2 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image2.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何听报告&lt;br /&gt;
* 带读Attention is all you need论文的剩余部分&lt;br /&gt;
* yuechi 和 ziyan 讲报告，分别介绍kv cache和大模型句法分析&lt;br /&gt;
&lt;br /&gt;
== 2025.09.17 Lesson 1 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image1 new.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 课程介绍&lt;br /&gt;
* 探讨什么是科研&lt;br /&gt;
* 带读Attention is all you need论文的摘要和引言&lt;br /&gt;
* houquan：讲解CSC工作&lt;br /&gt;
&lt;br /&gt;
== 2025秋：同学们期末的课程建议 ==&lt;br /&gt;
* 本学期总结：&lt;br /&gt;
** 系列小文章特别好，平生所学。&lt;br /&gt;
** 示范性读论文很好，下学期尝试写出来。&lt;br /&gt;
** 同学作报告一般，尤其提问环节。&lt;br /&gt;
** 如何示范性写论文？&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6185</id>
		<title>Writing-2025-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6185"/>
		<updated>2026-03-09T00:23:19Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 考试成绩 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= 专业写作（学硕、博士）	李正华	=&lt;br /&gt;
&lt;br /&gt;
* 学生：2025博士2025硕士	&lt;br /&gt;
* 助教：周月驰&lt;br /&gt;
* 时间：星期三	6-8 14:00-16:40	(从第三周开始上课)  14:45休息5分钟；15:35休息20分钟（实际会休息5分钟）&lt;br /&gt;
* 地点：理工楼153&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 &lt;br /&gt;
8	15:55-16:40 【15:40第三节课，通常16:25下课】&lt;br /&gt;
9	16:45-17:30&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 计划教学大纲 =&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-syllabus.png|&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 课程考核 =&lt;br /&gt;
课程考核分为两部分，闭卷考试和课上报告。&lt;br /&gt;
== 闭卷考试 ==&lt;br /&gt;
请大家提前预留时间参与考试！&lt;br /&gt;
&lt;br /&gt;
* 考试时间：12.25 14:00~15:30&lt;br /&gt;
* 考试地点：学号前20人在理工楼635，其余同学在理工楼103&lt;br /&gt;
* 考试内容：&lt;br /&gt;
** 2～3篇论文（课上同学讲的报告）&lt;br /&gt;
** 公众号《专业写作》系列文章（翻转课堂）&lt;br /&gt;
** 课上读过的论文（Transformer，ELMo，BERT，GPT，CLIP，ViT）&lt;br /&gt;
** 约7道题，每题200～300字，用自己的话来讲。&lt;br /&gt;
&lt;br /&gt;
* 考试要求：带两张A4纸，黑笔。诚信考试！&lt;br /&gt;
&lt;br /&gt;
== 课上报告 ==&lt;br /&gt;
未当堂汇报的同学需离线录制 8-12分钟 的视频报告（推荐使用腾讯会议录屏）。&lt;br /&gt;
&lt;br /&gt;
*   报告要求：同当堂汇报。&lt;br /&gt;
*   截止时间：北京时间 2025.12.31 23:59&lt;br /&gt;
*   提交格式：请提交一个 ZIP 压缩包，压缩包需命名为学号-姓名（例如：20254027007-周月驰.zip）。压缩包内文件结构如下：&lt;br /&gt;
    20254027007-周月驰&lt;br /&gt;
    ├── xx.mp4  (视频需 &amp;lt;30MB)&lt;br /&gt;
    ├── xx.pptx (汇报PPT)&lt;br /&gt;
    └── xx.docx (补充文档)&lt;br /&gt;
    (注：不需要提交论文原文了)&lt;br /&gt;
* 提交方式：压缩后发送助教邮箱 20254027007@stu.suda.edu.cn&lt;br /&gt;
&lt;br /&gt;
== 考试成绩 ==&lt;br /&gt;
* 李正华老师 2025 秋《专业写作课》成绩，请在课程主页上查看&lt;br /&gt;
* 如果确实觉得有问题，可以给助教发邮件，申请复查；但是如果复查后没有问题，可能要从严批阅，导致降分（5 分）&lt;br /&gt;
* 点击图片放大查看&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-all-scores.png&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 上课板书 =&lt;br /&gt;
== 2025.12.16 Lesson 13 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course13-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写title, abstract, and conclusion.&lt;br /&gt;
* 重读ViT的related work和方法。&lt;br /&gt;
* 舒仁义和李梦华同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.10 Lesson 12 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course12-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写related work.&lt;br /&gt;
* 重读CLIP的方法，读ViT的摘要和引言。&lt;br /&gt;
* 李传伟和姚昱同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.03 Lesson 11 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course11-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写introduction.&lt;br /&gt;
* 重读CLIP的引言，发现了很多可以改进的写作上的点。&lt;br /&gt;
* 邓皓文同学讲HS-DCell。&lt;br /&gt;
&lt;br /&gt;
== 2025.11.26 Lesson 10 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course10-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写experiments部分，分享人生感悟。&lt;br /&gt;
* 带读CLIP的方法部分。&lt;br /&gt;
* 孙家扬同学讲ViT。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 2025.11.19 Lesson 9 ==&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写method部分&lt;br /&gt;
* 带读CLIP的intro和related work&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌、杨文瑞四位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.12 Lesson 8 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course8-image2.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做实验&lt;br /&gt;
* 阅读CLIP的abstract和部分intro&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌三位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.5 Lesson 7 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course7-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何想idea&lt;br /&gt;
* 读完BERT&lt;br /&gt;
* 余田田、梁靖松分别讲FairGNN和有关药物生成的工作&lt;br /&gt;
&lt;br /&gt;
== 2025.10.29 Lesson 6 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course6-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写论文笔记&lt;br /&gt;
* 重读GPT，带读BERT摘要、引言&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; &lt;br /&gt;
GPT 的 finetune，针对一个具体任务&lt;br /&gt;
只能做分类任务 sentence-level 的任务&lt;br /&gt;
对于问答这样的任务（traversal-style 方式）：question &amp;lt;sep&amp;gt; answer GPT 编码后，最后一个位置的 hidden，经过 MLP，打分。4 个候选 answer（traversal-style)，softmax，最大化正确的 answer 的概率。&lt;br /&gt;
和之后的大一统的 prompt-based 的方法相比，不是一回事。&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
* 余田田、陈果、ruitong分别讲FairGNN、CLIP、LLaMA&lt;br /&gt;
&lt;br /&gt;
== 2025.10.22 Lesson 5 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course5-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何选论文、如何读论文&lt;br /&gt;
* 带读GPT技术报告&lt;br /&gt;
* 崔青青、许欣芸、吕喆分别讲图、AdaLora、DPO&lt;br /&gt;
&lt;br /&gt;
== 2025.10.15 Lesson 4 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course4-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨什么是一个完整的科研经历&lt;br /&gt;
* 带读elmo方法部分&lt;br /&gt;
* yanhui 讲eswa有关数据集的工作，罗小城和崔青青分别讲softthinking和正则图&lt;br /&gt;
&lt;br /&gt;
== 2025.10.11 Lesson 3 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course3-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做报告&lt;br /&gt;
* 带读elmo摘要、引言、相关工作&lt;br /&gt;
* shilin 和 ziheng 讲报告，分别介绍copyne和大小模型协同的csc&lt;br /&gt;
&lt;br /&gt;
== 2025.09.24 Lesson 2 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image2.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何听报告&lt;br /&gt;
* 带读Attention is all you need论文的剩余部分&lt;br /&gt;
* yuechi 和 ziyan 讲报告，分别介绍kv cache和大模型句法分析&lt;br /&gt;
&lt;br /&gt;
== 2025.09.17 Lesson 1 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image1 new.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 课程介绍&lt;br /&gt;
* 探讨什么是科研&lt;br /&gt;
* 带读Attention is all you need论文的摘要和引言&lt;br /&gt;
* houquan：讲解CSC工作&lt;br /&gt;
&lt;br /&gt;
== 2025秋：同学们期末的课程建议 ==&lt;br /&gt;
* 本学期总结：&lt;br /&gt;
** 系列小文章特别好，平生所学。&lt;br /&gt;
** 示范性读论文很好，下学期尝试写出来。&lt;br /&gt;
** 同学作报告一般，尤其提问环节。&lt;br /&gt;
** 如何示范性写论文？&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6184</id>
		<title>Writing-2025-fall</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Writing-2025-fall&amp;diff=6184"/>
		<updated>2026-03-09T00:22:43Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 考试成绩 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= 专业写作（学硕、博士）	李正华	=&lt;br /&gt;
&lt;br /&gt;
* 学生：2025博士2025硕士	&lt;br /&gt;
* 助教：周月驰&lt;br /&gt;
* 时间：星期三	6-8 14:00-16:40	(从第三周开始上课)  14:45休息5分钟；15:35休息20分钟（实际会休息5分钟）&lt;br /&gt;
* 地点：理工楼153&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 &lt;br /&gt;
8	15:55-16:40 【15:40第三节课，通常16:25下课】&lt;br /&gt;
9	16:45-17:30&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 计划教学大纲 =&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-syllabus.png|&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 课程考核 =&lt;br /&gt;
课程考核分为两部分，闭卷考试和课上报告。&lt;br /&gt;
== 闭卷考试 ==&lt;br /&gt;
请大家提前预留时间参与考试！&lt;br /&gt;
&lt;br /&gt;
* 考试时间：12.25 14:00~15:30&lt;br /&gt;
* 考试地点：学号前20人在理工楼635，其余同学在理工楼103&lt;br /&gt;
* 考试内容：&lt;br /&gt;
** 2～3篇论文（课上同学讲的报告）&lt;br /&gt;
** 公众号《专业写作》系列文章（翻转课堂）&lt;br /&gt;
** 课上读过的论文（Transformer，ELMo，BERT，GPT，CLIP，ViT）&lt;br /&gt;
** 约7道题，每题200～300字，用自己的话来讲。&lt;br /&gt;
&lt;br /&gt;
* 考试要求：带两张A4纸，黑笔。诚信考试！&lt;br /&gt;
&lt;br /&gt;
== 课上报告 ==&lt;br /&gt;
未当堂汇报的同学需离线录制 8-12分钟 的视频报告（推荐使用腾讯会议录屏）。&lt;br /&gt;
&lt;br /&gt;
*   报告要求：同当堂汇报。&lt;br /&gt;
*   截止时间：北京时间 2025.12.31 23:59&lt;br /&gt;
*   提交格式：请提交一个 ZIP 压缩包，压缩包需命名为学号-姓名（例如：20254027007-周月驰.zip）。压缩包内文件结构如下：&lt;br /&gt;
    20254027007-周月驰&lt;br /&gt;
    ├── xx.mp4  (视频需 &amp;lt;30MB)&lt;br /&gt;
    ├── xx.pptx (汇报PPT)&lt;br /&gt;
    └── xx.docx (补充文档)&lt;br /&gt;
    (注：不需要提交论文原文了)&lt;br /&gt;
* 提交方式：压缩后发送助教邮箱 20254027007@stu.suda.edu.cn&lt;br /&gt;
&lt;br /&gt;
== 考试成绩 ==&lt;br /&gt;
* 点击图片放大查看&lt;br /&gt;
* 李正华老师 2025 秋《专业写作课》成绩公示&lt;br /&gt;
* 如果确实觉得有问题，可以给助教发邮件，申请复查；但是如果复查后没有问题，可能要从严批阅，导致降分（5 分）&lt;br /&gt;
&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-all-scores.png&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
= 上课板书 =&lt;br /&gt;
== 2025.12.16 Lesson 13 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course13-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写title, abstract, and conclusion.&lt;br /&gt;
* 重读ViT的related work和方法。&lt;br /&gt;
* 舒仁义和李梦华同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.10 Lesson 12 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course12-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写related work.&lt;br /&gt;
* 重读CLIP的方法，读ViT的摘要和引言。&lt;br /&gt;
* 李传伟和姚昱同学讲报告。&lt;br /&gt;
&lt;br /&gt;
== 2025.12.03 Lesson 11 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course11-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写introduction.&lt;br /&gt;
* 重读CLIP的引言，发现了很多可以改进的写作上的点。&lt;br /&gt;
* 邓皓文同学讲HS-DCell。&lt;br /&gt;
&lt;br /&gt;
== 2025.11.26 Lesson 10 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File: Writing-2025-fall-course10-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写experiments部分，分享人生感悟。&lt;br /&gt;
* 带读CLIP的方法部分。&lt;br /&gt;
* 孙家扬同学讲ViT。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 2025.11.19 Lesson 9 ==&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写method部分&lt;br /&gt;
* 带读CLIP的intro和related work&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌、杨文瑞四位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.12 Lesson 8 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course8-image2.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做实验&lt;br /&gt;
* 阅读CLIP的abstract和部分intro&lt;br /&gt;
* 彭基轩、刘奕辰、赵文斌三位同学讲报告&lt;br /&gt;
&lt;br /&gt;
== 2025.11.5 Lesson 7 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course7-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何想idea&lt;br /&gt;
* 读完BERT&lt;br /&gt;
* 余田田、梁靖松分别讲FairGNN和有关药物生成的工作&lt;br /&gt;
&lt;br /&gt;
== 2025.10.29 Lesson 6 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course6-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何写论文笔记&lt;br /&gt;
* 重读GPT，带读BERT摘要、引言&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; &lt;br /&gt;
GPT 的 finetune，针对一个具体任务&lt;br /&gt;
只能做分类任务 sentence-level 的任务&lt;br /&gt;
对于问答这样的任务（traversal-style 方式）：question &amp;lt;sep&amp;gt; answer GPT 编码后，最后一个位置的 hidden，经过 MLP，打分。4 个候选 answer（traversal-style)，softmax，最大化正确的 answer 的概率。&lt;br /&gt;
和之后的大一统的 prompt-based 的方法相比，不是一回事。&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
* 余田田、陈果、ruitong分别讲FairGNN、CLIP、LLaMA&lt;br /&gt;
&lt;br /&gt;
== 2025.10.22 Lesson 5 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course5-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何选论文、如何读论文&lt;br /&gt;
* 带读GPT技术报告&lt;br /&gt;
* 崔青青、许欣芸、吕喆分别讲图、AdaLora、DPO&lt;br /&gt;
&lt;br /&gt;
== 2025.10.15 Lesson 4 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course4-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨什么是一个完整的科研经历&lt;br /&gt;
* 带读elmo方法部分&lt;br /&gt;
* yanhui 讲eswa有关数据集的工作，罗小城和崔青青分别讲softthinking和正则图&lt;br /&gt;
&lt;br /&gt;
== 2025.10.11 Lesson 3 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course3-image1.jpg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何做报告&lt;br /&gt;
* 带读elmo摘要、引言、相关工作&lt;br /&gt;
* shilin 和 ziheng 讲报告，分别介绍copyne和大小模型协同的csc&lt;br /&gt;
&lt;br /&gt;
== 2025.09.24 Lesson 2 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image2.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 探讨如何听报告&lt;br /&gt;
* 带读Attention is all you need论文的剩余部分&lt;br /&gt;
* yuechi 和 ziyan 讲报告，分别介绍kv cache和大模型句法分析&lt;br /&gt;
&lt;br /&gt;
== 2025.09.17 Lesson 1 ==&lt;br /&gt;
&amp;lt;gallery&amp;gt;&lt;br /&gt;
File:Writing-2025-fall-course1-image1 new.jpeg&lt;br /&gt;
&amp;lt;/gallery&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* 课程介绍&lt;br /&gt;
* 探讨什么是科研&lt;br /&gt;
* 带读Attention is all you need论文的摘要和引言&lt;br /&gt;
* houquan：讲解CSC工作&lt;br /&gt;
&lt;br /&gt;
== 2025秋：同学们期末的课程建议 ==&lt;br /&gt;
* 本学期总结：&lt;br /&gt;
** 系列小文章特别好，平生所学。&lt;br /&gt;
** 示范性读论文很好，下学期尝试写出来。&lt;br /&gt;
** 同学作报告一般，尤其提问环节。&lt;br /&gt;
** 如何示范性写论文？&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6179</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6179"/>
		<updated>2026-03-06T01:06:38Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 信息检索综合实践 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ群: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70-80分&lt;br /&gt;
** 一系列作业，每个作业10-20分（形式检查为辅、考核为主）&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到csteaching&lt;br /&gt;
&lt;br /&gt;
* 期末面对面小测验：10分&lt;br /&gt;
** 考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
&lt;br /&gt;
* 平时成绩：10-20分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 网址：[http://csteaching.suda.edu.cn csteaching]&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体课程（含作业） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 10%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 20%【比例低一点】&lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6178</id>
		<title>Ir-2026-spring</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=Ir-2026-spring&amp;diff=6178"/>
		<updated>2026-03-06T01:06:22Z</updated>

		<summary type="html">&lt;p&gt;Zhli：/* 信息检索综合实践 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
= 信息检索综合实践 =&lt;br /&gt;
&lt;br /&gt;
李正华&lt;br /&gt;
&lt;br /&gt;
* 学生：计23计科1班	 	 	 &lt;br /&gt;
* 助教：吕喆、梅睿桐  &lt;br /&gt;
* QQ: xx&lt;br /&gt;
* 时间：周四 6-9 节课 1-17 周&lt;br /&gt;
* 地点：理工楼238&lt;br /&gt;
&lt;br /&gt;
== 上课基本要求 ==&lt;br /&gt;
* 不能做的事情：打游戏、看课程无关视频、刷网页&lt;br /&gt;
* 认真读作业要求，按时交作业。csteaching&lt;br /&gt;
* 不能抄袭别人或网上的，自己做；不要把自己的作业给别人&lt;br /&gt;
&lt;br /&gt;
== 课程建议 ==&lt;br /&gt;
* 每个作业，截止时间后，把成绩发给大家，并用ppt给大家讲一下批作业发现的问题，题目分析&lt;br /&gt;
* 上课期间：请大家积极提问。遇到大家都无法理解的公共问题，我会补充讲解&lt;br /&gt;
* 非上课时间提问&lt;br /&gt;
** 建议同学们在群里提问（包括但不限于代码的bug、不理解算法、作业资源和提交等），由其他同学帮助解答；&lt;br /&gt;
** 群里的提问如果其他同学也无法回答，可以私信助教（仅限xxx，如周四晚上7点到9点，吕喆增加）；&lt;br /&gt;
&lt;br /&gt;
== 计算成绩的规则和说明（待定） ==&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;核心要求：掌握最基本的概念、方法、算法&amp;lt;/font&amp;gt;&lt;br /&gt;
* 实验作业：70-80分&lt;br /&gt;
** 一系列作业，每个作业10-20分（形式检查为辅、考核为主）&lt;br /&gt;
** 必须按照规定时间，按照规定格式要求，将实验报告+源代码，提交到csteaching&lt;br /&gt;
&lt;br /&gt;
* 期末面对面小测验：10分&lt;br /&gt;
** 考察课程相关的基础知识，看看作业是否是自己做的&lt;br /&gt;
&lt;br /&gt;
* 平时成绩：10-20分&lt;br /&gt;
** 不能迟到、早退，特殊情况必须请假，并带辅导员签字的假条；&lt;br /&gt;
** 点名时，如果发现名单上没有你的名字，及时提出&lt;br /&gt;
&lt;br /&gt;
== 提交作业说明 ==&lt;br /&gt;
* 网址：[http://csteaching.suda.edu.cn csteaching]&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;作业迟交了则最终成绩会按一定比例缩减&amp;lt;/font&amp;gt;&lt;br /&gt;
* 包含两部分&lt;br /&gt;
** 实验报告（pdf文件，&amp;lt;font color='red&amp;gt;请把word转为pdf&amp;lt;/font&amp;gt;）&lt;br /&gt;
*** 请按照实验模版[[:文件:ir-2022-spring-report.doc]]，认真填写个人信息、实验题目、实验内容等&lt;br /&gt;
*** 不要大段粘贴代码，最多可以粘贴核心的一小段代码，&amp;lt;font color='red&amp;gt;粘贴大段代码会扣分&amp;lt;/font&amp;gt;&lt;br /&gt;
*** 写清楚自己的解决思路，尤其是遇到的难点和如何解决&lt;br /&gt;
*** 建议可以画流程图或者写伪代码。&lt;br /&gt;
*** 解决思路的流程图中是以文字为主还是以代码为主？报告中不要直接放代码。文字为主，不在于写得长，而在于写清楚，表明你确实做了、想了。&lt;br /&gt;
*** 问：流程图可以改成自然语言描述或者是伪代码吗？答：流程图也可以画的很high-level的。大家自由发挥。也可以画到纸上然后拍照截图。模块化思维 大问题分解小问题 。&lt;br /&gt;
*** &amp;lt;font color='red&amp;gt;将程序运行结果截图，没有运行结果会扣分&amp;lt;/font&amp;gt;，中间的输出结果/文件可以截图一部分&lt;br /&gt;
** 附件（.zip压缩包）&lt;br /&gt;
*** 源代码：代码不要都团在一起，请用空行对代码进行分隔，并简单注释代码块的功能&lt;br /&gt;
*** readme.txt文件：说明如何运行你的程序，需要什么环境，如windows或linux，python版本如python3.5&lt;br /&gt;
* 提交前自我检查&lt;br /&gt;
** 是否有包含readme.txt文件解释如何编译执行你的程序。 &amp;lt;font color='red&amp;gt;如没有该文件，将减分。&amp;lt;/font&amp;gt;&lt;br /&gt;
** 是否认真完成实验报告&lt;br /&gt;
** 是否可以按照readme.txt正确编译和运行程序&lt;br /&gt;
** 是否包含别人的代码，&amp;lt;font color='red&amp;gt;抄袭和被抄袭的都是0分&amp;lt;/font&amp;gt;&lt;br /&gt;
** 期末可能会用软件做自动抄袭检查&lt;br /&gt;
** 等这学期最后几周，我们可能统一对所有的作业做自动查重，到时候也会查出一些问题。 &amp;lt;font color='red&amp;gt;请大家一定要自己做，编程能力差一点，就做得简单一点，能力强，就做得好一点。但是一定要自己做。 &amp;lt;/font&amp;gt;&lt;br /&gt;
* 提交作业命名规则&lt;br /&gt;
** 实验报告（姓名学号.pdf）&lt;br /&gt;
** 附件（姓名学号.zip）&lt;br /&gt;
&lt;br /&gt;
== 实验报告word模板 ==&lt;br /&gt;
* [[:文件:ir-2022-spring-report.doc]]&lt;br /&gt;
&lt;br /&gt;
== 具体课程（含作业） == &lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! style=&amp;quot;text-align:left;&amp;quot;| 作业&lt;br /&gt;
! 成绩比例&lt;br /&gt;
! 评分要点&lt;br /&gt;
|-&lt;br /&gt;
| 分字&lt;br /&gt;
| 5%&lt;br /&gt;
| 按字节读取并判断高位&lt;br /&gt;
|-&lt;br /&gt;
| 单词计数&lt;br /&gt;
| 5%&lt;br /&gt;
| 无&lt;br /&gt;
|-&lt;br /&gt;
| 最大匹配分词&lt;br /&gt;
| 10%&lt;br /&gt;
| 算法和评价正确实现&lt;br /&gt;
|-&lt;br /&gt;
| 网页正文抽取&lt;br /&gt;
| 10%&lt;br /&gt;
| 按要求完成两个任务&lt;br /&gt;
|-&lt;br /&gt;
| 倒排索引&lt;br /&gt;
| 10%&lt;br /&gt;
| 高效创建倒排文件&lt;br /&gt;
|-&lt;br /&gt;
| 布尔查询&lt;br /&gt;
| 10%&lt;br /&gt;
| inter和union的复杂度为O(n)，复杂查询用堆栈判断优先级&lt;br /&gt;
|-&lt;br /&gt;
| 网页相关性排序&lt;br /&gt;
| 15%&lt;br /&gt;
| 基于向量空间模型VSM、tf-idf权重&lt;br /&gt;
|-&lt;br /&gt;
| 爬虫和某机构主页检索系统&lt;br /&gt;
| 15%&lt;br /&gt;
| 实现爬虫，系统架构设计良好，说明文档详细，UI完整&lt;br /&gt;
|-&lt;br /&gt;
| &amp;lt;font color='black&amp;gt;基于深度学习的检索系统&amp;lt;/font&amp;gt;&lt;br /&gt;
| 20%【比例低一点】&lt;br /&gt;
| Contriever：重现部分实验结果；自己实现评价指标；在上一个作业中的爬虫和检索系统的基础上，自己设计、标注 10 个 query，对比向量空间模型VSM 和Contriever 的效果，给出评价结果。建议：VSM 给 100 个结果，然后 Contriever 重排序，然后人工标注，具体如何标注更合理，自己考虑好。&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 信息检索课程介绍 ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/ir-introduction-v0.4.pdf PPT下载]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-low-quality.mp4 课程介绍]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-1.mp4 课程介绍-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro-part-2.mp4 课程介绍-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/course-intro.jpg 图]&lt;br /&gt;
&lt;br /&gt;
* &amp;lt;font color='red&amp;gt;和2022年课程的区别&amp;lt;/font&amp;gt;：增加了'''基于深度学习的检索'''的内容，删除'''词性标注'''相关内容&lt;br /&gt;
&lt;br /&gt;
== 信息检索系统介绍 ==&lt;br /&gt;
* 2022春视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/intro-to-info-retrieval.mp4 信息检索系统介绍]&lt;br /&gt;
&lt;br /&gt;
= 具体作业 =&lt;br /&gt;
&lt;br /&gt;
== 作业1：分字（C++语言） ==&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-low-quality.mp4 作业1]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-1.mp4 作业1-part1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-part-2.mp4 作业1-part2]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-1.jpg 图1]、 [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/split-char-figure-2.jpg 图2]&lt;br /&gt;
* UTF-8数据：[[文件:sentence.txt]]&lt;br /&gt;
* UFT-8编码规则：&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
1字节 0xxxxxxx&lt;br /&gt;
2字节 110xxxxx 10xxxxxx&lt;br /&gt;
3字节 1110xxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx&lt;br /&gt;
6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业2：单词计数 ==&lt;br /&gt;
* 课件 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/word-count.pdf PPT下载]&lt;br /&gt;
* 2022春视频：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-low-quality.mp4 作业2]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-count-2.mp4 作业2] &lt;br /&gt;
* 数据 [http://hlt.suda.edu.cn/~zhli/teach/ir-2019-spring/sample-en.txt txt下载]&lt;br /&gt;
&lt;br /&gt;
== 作业3：最大匹配分词 == &lt;br /&gt;
* 作业提交时间截止时间：第5周3.25下课之前提交&lt;br /&gt;
* 课件：前向最大匹配 PDF文件--[[文件:Word-seg-max-match.pdf]]；PPT文件--[[文件:Word-seg-max-match.zip]]&lt;br /&gt;
* 2022春视频和图片：&lt;br /&gt;
** 低画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match-low-quality.mp4 作业3]&lt;br /&gt;
** 高画质：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.mp4 作业3] &lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word-seg-max-match.jpg 图] &lt;br /&gt;
&lt;br /&gt;
* 数据下载：&lt;br /&gt;
** 字典：[[文件:dict.txt]] &lt;br /&gt;
** 待分词：[[文件:sentence.txt]] &lt;br /&gt;
** 正确答案（人工标注的，你的模型的预测结果要和这个文件进行对比，从而得到P/R/F值）：[[文件:answer.txt]]；&lt;br /&gt;
** 正向最大匹配分词模型的预测结果（如果你的程序写对了，那么应该和这个结果一模一样）：[[文件:out.txt]]&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
*正确实验结果&lt;br /&gt;
**正确识别的词数：20263&lt;br /&gt;
**识别出的总体个数：20397&lt;br /&gt;
**测试集中的总体个数：20454&lt;br /&gt;
**正确率：0.99343&lt;br /&gt;
**召回率：0.99066&lt;br /&gt;
**F值：0.99204 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 作业4：网页正文抽取 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
* 2022春视频： [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-content-extraction.mp4 作业4]&lt;br /&gt;
* 课件（&amp;lt;font color='red'&amp;gt;请严格按照课件要求完成作业&amp;lt;/font&amp;gt;）： &lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.ppt]]&lt;br /&gt;
** [[:文件:ir-2022-spring-web-page-content-extraction.pdf]]&lt;br /&gt;
* 数据&lt;br /&gt;
** 1.html和2.html [[:文件:ir-2022-spring-example-html.zip]]&lt;br /&gt;
** data-1k：1000个html文件 [[:文件:ir-2022-spring-all-html.zip]] （如果文件出现乱码，请到qq群里下载）&lt;br /&gt;
&lt;br /&gt;
== 作业5：倒排索引 == &lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：第8周4.15下课前提交&lt;br /&gt;
* 课件： &lt;br /&gt;
** 仅供参考，与本次作业要求无关：[[:文件:ir-2022-spring-inverted-index-simplified.ppt]]&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.mp4 作业5]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/inverted-index.jpg 图]&lt;br /&gt;
* 数据&lt;br /&gt;
** 停用词表：[https://github.com/goto456/stopwords github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/stopwords.zip 苏大本地下载] &lt;br /&gt;
** 结巴词典：[https://github.com/fxsjy/jieba/tree/master/extra_dict github网址] [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/word_dict.zip 苏大本地下载]&lt;br /&gt;
** 结巴词典文件每一行有3列，为：单词、词频、词性，只需要使用第一列的单词即可，使用small进行调试，提交作业用big&lt;br /&gt;
&lt;br /&gt;
== 作业6：布尔查询 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：x.x下课前提交&lt;br /&gt;
*  2022春视频和图片： &lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.mp4 作业6]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/bool-query.jpg 图]&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本次作业使用的倒排索引文件（可以在作业5的基础上进行优化），&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;不需要提供构建倒排索引的代码，但在实验报告中给出倒排索引文件的说明，参考侯皓文同学&amp;lt;/font&amp;gt;&lt;br /&gt;
** 交集、并集操作用inter()、union()这两个函数单独封装&lt;br /&gt;
** &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;对4个语句&amp;lt;/font&amp;gt; 'A', 'B', 'A AND B', 'A OR B' （A、B为自定义的查询词） 分别进行一次查询，每次的查询结果单独保存到一个txt文件中，以查询语句作为文件名（如 'A AND B.txt'`）&lt;br /&gt;
** 结果展示部分，文件按名字字母序排序：指字符序（用内置的sort即可），先用pinyin包转成拼音再排序也可以，不要自行改变文件名（如 阿大.txt -&amp;gt; 34.txt）&lt;br /&gt;
** 实现更复杂的查询，如：'A AND B OR C' 可以加分&lt;br /&gt;
** 查询词的加重（用#标记）不做强制要求，但做了加分&lt;br /&gt;
&lt;br /&gt;
== 作业7：基于向量空间模型（VSM）和tf-idf权重的网页相关性排序 ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank.mp4 作业7]&lt;br /&gt;
** 图片：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-1.jpg 图片1]  [http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-page-rank-2.jpg 图片2]&lt;br /&gt;
* 作业要求：&lt;br /&gt;
** 如果无法理解向量空间模型，可以选择做tf-idf作业，但最多只给50分&lt;br /&gt;
** 实现基于向量空间模型的网页相关性排序&lt;br /&gt;
** 给定一个查询Q：可以是手动用空格分好词的&amp;quot;李正华 招收 学生&amp;quot;；也可以是未分词的&amp;quot;李正华招收学生&amp;quot;，之后用最大匹配分词分好词 -&amp;gt; &amp;quot;李正华 招收 学生&amp;quot;&lt;br /&gt;
** 注释：一个给定分词的查询Q实际上等价于布尔查询OR：&amp;quot;李正华 招收 学生&amp;quot; &amp;lt;=&amp;gt; &amp;quot;李正华 OR 招收 OR 学生&amp;quot;&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 附件中给出本任务所使用的倒排索引文件&lt;br /&gt;
** 在实验报告中说明对于余弦相似度计算中的：di[k]、q[k]、|di|、|q|是如何处理或存储的&lt;br /&gt;
** 附件中给出一个查询Q的结果，保存为文本文件&amp;quot;Q.txt&amp;quot;中，格式为：&lt;br /&gt;
&lt;br /&gt;
  文档名1（余弦相似度Sim） # Sim值可不除以|q|的值，一个例子： 阿鲁巴岛.txt(0.64)&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  文档名2（余弦相似度Sim）&lt;br /&gt;
  句子1&lt;br /&gt;
  句子2&lt;br /&gt;
  ...&lt;br /&gt;
  ......&lt;br /&gt;
&lt;br /&gt;
== 作业8：爬虫和某机构主页检索系统（综合项目） ==&lt;br /&gt;
&lt;br /&gt;
* 作业提交时间截止时间：xx之前提交&lt;br /&gt;
** 视频：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.mp4 作业8]&lt;br /&gt;
** PPT：[http://hlt.suda.edu.cn/LA/Ir-2022-Spring/web-spider.pptx PPT]&lt;br /&gt;
* 任务一：用&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;爬虫模块&amp;lt;/font&amp;gt;尽量完整地爬下来一个机构对应的所有静态网页（html或htm后缀），保存到磁盘中：&lt;br /&gt;
** 苏大、苏大计算机学院（规模小一点）都可以&lt;br /&gt;
** orphan网页不用考虑&lt;br /&gt;
* 任务二：基于爬取的网页，做一个完整的检索系统（以后可以考虑不断完善、定时更新）：&lt;br /&gt;
** 1. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页正文提取模块&amp;lt;/font&amp;gt;（同作业4的实战部分一致）&lt;br /&gt;
** 2. 处理网页正文的&amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;分句、分词模块&amp;lt;/font&amp;gt;（可以用作业3的最大匹配分词，也可以用第三方的分词器，如jieba）&lt;br /&gt;
** 3. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;倒排索引模块&amp;lt;/font&amp;gt;：基于处理好的网页正文，建立倒排索引文件（同作业5一致）&lt;br /&gt;
** 4. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;网页排序模块&amp;lt;/font&amp;gt;：实现网页相关性排序（同作业7一致）&lt;br /&gt;
** 5. &amp;lt;font color=&amp;quot;red&amp;quot;&amp;gt;查询模块&amp;lt;/font&amp;gt;：提供查询接口，用户输入查询词后显示网页名（暂定为网页的title），和包含查询词的句子，查询词进行highlight处理（如#查询词#）。查询接口可以用命令行实现，提供前端UI界面（Web或Application都可以）会获得加分。&lt;br /&gt;
&lt;br /&gt;
注意：把网页源文件（html文件）保存好，避免重复爬。例如优化了网页正文提取模块、或突然想用一个更好的分词器&lt;br /&gt;
&lt;br /&gt;
* 作业提交说明：&lt;br /&gt;
** 源代码：任务一和任务二的所有代码都要提交，每个模块（共6个，在上方已用红色标出）在readme中指明在哪个python文件中实现的&lt;br /&gt;
** 处理好的网页数据（可选）：原始网页，提取出并分好句、分好词的网页正文，若网页数据特别大的话可以不要&lt;br /&gt;
** 在实验报告中将三项统计信息放到表格中：网页（文档）数、句子数、单词数&lt;br /&gt;
** 倒排索引文件（必备）&lt;br /&gt;
** 说明文档：(每个模块的)实现的功能，如何使用，接口等，内容不限&lt;br /&gt;
&lt;br /&gt;
== 作业9：深度学习方法&amp;amp;检索结果的评价 ==&lt;br /&gt;
&lt;br /&gt;
* 要求&lt;br /&gt;
** 账号环境，跑推理代码，重现完成部分实验。&lt;br /&gt;
*** 具体要跑哪些实验，请看文档最后的表格：[https://resplendent-gumdrop-ad2cd4.netlify.app/contriever-ir-course-assignment/ 具体文档] &lt;br /&gt;
** 自己实现评价指标，自己的评价指标的结果，和contriever 的结果一致。&lt;br /&gt;
** VSM和 Contriever 的对比&lt;br /&gt;
 &amp;lt;nowiki&amp;gt; 针对自己实现的“苏大计算机官网搜索引擎”，去对比VSM和Contriever的效果。&lt;br /&gt;
     自己设计10个难度不同的 query，然后 VSM 返回 50 个结果，把这 50 个结果随机打乱顺序（这一步很重要），然后人工做一个标注（给一个排序）【如果觉得 10 个 query 太多，5 个也行】&lt;br /&gt;
     Contriever对 50 个结果重排序&lt;br /&gt;
     比较两种方法的结果：NDCG@5      NDCG@10       NDCG@20等&lt;br /&gt;
     如果有能力、有时间，可以分析下：什么样的query，VSM 做得好；什么样的 query，Contriever 做得好。 &amp;lt;/nowiki&amp;gt;&lt;br /&gt;
** 实验报告体现出自己做了什么、遇到的困难及如何解决。&lt;br /&gt;
&lt;br /&gt;
* 参考资料&lt;br /&gt;
** 上面的文档&lt;br /&gt;
** 微信公众号”语析LAGroup“中 contriever 论文解读&lt;br /&gt;
** contriever 原文&lt;br /&gt;
&lt;br /&gt;
== 时间表 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
 &amp;lt;nowiki&amp;gt;&lt;br /&gt;
3.5 第1周&lt;br /&gt;
3.12 第2周&lt;br /&gt;
&lt;br /&gt;
xxx&lt;br /&gt;
3.25 第5周&lt;br /&gt;
4.1 第6周&lt;br /&gt;
4.29 第10周&lt;br /&gt;
5.6 第11周&lt;br /&gt;
5.27 第14周&lt;br /&gt;
6.3 第15周&lt;br /&gt;
6.17 第17周&lt;br /&gt;
&lt;br /&gt;
1	08:00-08:45&lt;br /&gt;
2	08:50-09:35&lt;br /&gt;
3	09:55-10:40&lt;br /&gt;
4	10:45-11:30&lt;br /&gt;
5	11:35-12:20&lt;br /&gt;
6	14:00-14:45&lt;br /&gt;
7	14:50-15:35 【休息5分钟，+15分钟】&lt;br /&gt;
8	15:55-16:40 &lt;br /&gt;
9	16:45-17:30 【17:15】   &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
考虑来2-3 次考试。&lt;br /&gt;
闭卷考试，比较正式的那种。在机房里就行。然后拍照留存？&lt;br /&gt;
&lt;br /&gt;
2次考试的方案：&lt;br /&gt;
倒排搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3次考试的方案：&lt;br /&gt;
最大匹配分词搞完，考一次&lt;br /&gt;
布尔查询搞完 考一次&lt;br /&gt;
最后一次 &lt;br /&gt;
&lt;br /&gt;
上机课9 个作业，实验报告，主要是形式审查，占比比较低。要根据考试的成绩，然后加权得到每一次作业的成绩。&lt;br /&gt;
最后，9 个作业再按照一定比例，得到实验成绩。&lt;br /&gt;
&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;/div&gt;</summary>
		<author><name>Zhli</name></author>
	</entry>
</feed>