项目建议 60 分钟学习等级 3/8

PYTHON LESSON 040

三级综合:词频统计

综合运用字典统计、列表处理与打擂台算法,完成词频统计综合项目。

00 · 学习目标

这一课要解决什么?

先想一想一篇英语作文里哪个单词出现最多?程序能一秒数出来吗?
完成任务作文词频分析仪
学习顺序需求 → 模块拆分 → 分步实现 → 系统测试 → 讲解

学完后,你应该能够

  • split() 把句子拆成单词列表
  • 字典计数:有则加一,无则设一
  • sorted(字典) 按键排序输出

01 · 核心概念

字典、列表与算法综合

字典、列表与算法综合:词频统计的算法可以描述为:①把句子拆成单词;②用字典逐个计数;③按字典序输出结果;④打擂台找出冠军。先把步骤说清楚再写代码——这就是“算法的概念与描述”考点要求的思维。

考级对应GESP Python 3 级 · 综合应用GESP Python 3 级 · 算法的概念与描述
学习边界

复杂度隐藏常数与硬件差异,但仍是比较规模增长的核心工具。

02 · 语法与规则

先记住这 3 条,再开始写程序

01split() 把句子拆成单词列表

先准确读出这条写法的结构与作用。

02字典计数:有则加一,无则设一

换一组最小数据,手工推演一次结果。

03sorted(字典) 按键排序输出

再用边界值或反例确认它的适用条件。

03 · 完整实例

代码、运行结果和解释放在一起看

word-frequency-final.pyPYTHON 3.12
# 三级综合:词频统计小程序
sentence = "apple banana apple orange banana apple"
words = sentence.split()

count = {}
for w in words:
    if w in count:
        count[w] = count[w] + 1
    else:
        count[w] = 1

print("文章单词:", words)
print("—— 词频统计 ——")
for w in sorted(count):
    print(w, "出现了", count[w], "次")

# 找到出现次数最多的单词
best_word = ""
best_count = 0
for w in count:
    if count[w] > best_count:
        best_word = w
        best_count = count[w]
print("出现最多的是:", best_word, "(", best_count, "次)")
运行结果OUTPUT
文章单词: ['apple', 'banana', 'apple', 'orange', 'banana', 'apple']
—— 词频统计 ——
apple 出现了 3 次
banana 出现了 2 次
orange 出现了 1 次
出现最多的是: apple ( 3 次)

“有则加一、无则设一”是字典计数的万能口诀,一定要背下来。

在新标签运行和修改这个实例已装入本课代码 · 可自定义输入 · 可提交判题

04 · 逐步理解

每一步只解决一个问题

  1. 01

    算法四步走

    词频统计的算法可以描述为:①把句子拆成单词;②用字典逐个计数;③按字典序输出结果;④打擂台找出冠军。先把步骤说清楚再写代码——这就是“算法的概念与描述”考点要求的思维。

  2. 02

    split:句子变列表

    sentence.split() 按空格把字符串切开,得到一个单词列表。括号里也可以指定其他分隔符,比如按逗号切。字符串方法 split 是文本处理的第一步。

    PYTHON
    words = sentence.split()
  3. 03

    字典计数:万能口诀

    遇到单词 w:如果它已经在字典里,次数加一;否则,设为 1。这个“有则加一、无则设一”的模式能数单词、数票数、数任何东西,是三级考试的高频套路。

    PYTHON
    if w in count:
        count[w] = count[w] + 1
    else:
        count[w] = 1
  4. 04

    按字典序输出

    sorted(count) 把字典的键排好序(字母顺序),再逐个取出对应的次数。结果整齐划一,判题时也有确定答案。

    PYTHON
    for w in sorted(count):
        print(w, count[w])
  5. 05

    打擂台找冠军

    best_count 从 0 开始,逐个单词挑战:谁的次数高,就把名字和次数都记下来。循环结束,擂主就是出现最多的单词。一级学的打擂台,到这里依然宝刀不老。

    PYTHON
    if count[w] > best_count:
        best_word = w
        best_count = count[w]
  6. 06

    还能升级成什么

    把 sentence 换成一整段英文(用三引号字符串),你的程序就是简易版“作文分析器”;加一句 if len(w) > 3 只统计长单词,就更像真的分析工具了。三级综合项目,重在把零散知识串成线。

05 · 练习与检验

自己写出来,才算真正学会

本课实作步骤
  1. 1运行程序,核对每个单词的次数
  2. 2换一句自己的英语句子上来统计
  3. 3找出出现次数最多的单词
  4. 4挑战:只统计长度大于 3 的单词
打开本课编程实验室编辑、运行、测试、判题都在一个页面完成

06 · 完整知识

继续理解定义、规则和适用边界

第一次学习先完成上面的六个步骤;需要查定义、核对规则、分析误区或理解“为什么”时,再展开对应知识章。

算法方法算法、复杂度与解题验证把题意转成输入、状态、规则与输出,用正确性和复杂度共同评价解法。

正式定义

算法是解决一类问题的有限、明确步骤。正确性说明算法对所有满足前置条件的输入都得到规定结果;时间和空间复杂度描述输入规模增长时资源使用的增长量级。

必须掌握

  • 先明确输入规模 n、数据范围、目标和允许误差,再选择数据结构与算法。
  • O(1)、O(log n)、O(n)、O(n log n)、O(n²)、O(2ⁿ) 表示增长量级,不是精确运行秒数。
  • 顺序代码复杂度取较大项,嵌套循环常相乘,二分每步把范围缩小一半。
  • 正确性可用循环不变量、数学归纳、交换论证、反证或状态定义来说明。
  • 样例只验证少量输入;必须自己设计边界、极端、重复、有序/逆序和无解数据。
  • 优化前先得到正确基线并测量瓶颈,不为小数据盲目增加复杂实现。

常见误区

  • 只看样例通过就宣称正确
  • 不看数据范围使用 O(n²)
  • 二分区间开闭混用
  • 把 O(n) 当成永远比 O(log n) 慢固定倍数

适用边界

  • 复杂度隐藏常数与硬件差异,但仍是比较规模增长的核心工具。
  • 考场策略、课程完成度和算法能力是不同证据,任何单项都不能保证考级通过。
打开本章完整示例与独立阅读页 →
编码与文本字符串、转义、切片与格式化从不可变字符序列到检索、拆分、拼接、格式化和常用判断方法。

正式定义

str 是不可变的 Unicode 字符序列。下标访问单个字符,切片生成新字符串;任何看似“修改字符串”的方法都会返回新对象。

必须掌握

  • 下标从 0 开始,负下标从末尾开始;切片 s[start:stop:step] 不包含 stop,step 不能为 0。
  • 转义序列用于在字面量中表示换行、制表、引号、反斜杠或码点;原始字符串仍有末尾反斜杠限制。
  • find 找不到返回 -1,index 找不到抛 ValueError;count 统计不重叠出现次数。
  • split 把字符串拆成列表,join 用一个字符串连接可迭代对象中的字符串,strip 只删除两端字符。
  • f-string 的格式说明可控制宽度、对齐、精度、进制和百分比;格式化不改变原值。
  • isalpha/isdigit 等按 Unicode 定义,不只识别英文字母和 ASCII 数字。

常见误区

  • 尝试 s[0] = 'A' 原地修改字符串
  • 把 strip('ab') 误解为删除完整子串 'ab'
  • find 返回 -1 后直接拿去当有效下标
  • 把字节长度与字符长度混为一谈

适用边界

  • 正则表达式不在低等级字符串必修范围,但复杂模式匹配时应使用 re,而不是堆叠大量 split/find。
  • 面向用户的字符计数还可能涉及组合字符和字素簇,len 统计的是 Unicode 码点序列长度。
打开本章完整示例与独立阅读页 →
核心数据结构列表、元组、字典与集合按顺序、可变性、唯一性和查找需求选择容器,并掌握遍历、推导式、排序与复制。

正式定义

容器保存多个对象。list 是可变有序序列,tuple 是不可变有序序列,dict 保存唯一键到值的映射,set 保存无序且不重复的可哈希对象。

必须掌握

  • list 支持下标、切片、append、extend、insert、pop、remove 与 sort;多数修改方法返回 None。
  • tuple 的逗号比括号更关键,单元素元组必须写成 (value,)。
  • dict 保持插入顺序;键必须可哈希且唯一,get 可提供缺省值,items 同时遍历键和值。
  • set 用于去重与集合运算:| 并、& 交、- 差、^ 对称差;空集合必须写 set()。
  • enumerate 同时给出序号和值,zip 并行遍历多个可迭代对象,默认在最短输入处停止。
  • 浅复制只复制最外层容器;嵌套可变对象仍可能共享。

常见误区

  • 把 list.sort() 的返回值赋回列表
  • 遍历 dict 时同时改变其大小
  • 用可变 list 当字典键
  • 把 set 当成有固定顺序的序列

适用边界

  • 大量从队首删除时 list.pop(0) 是 O(n),应使用 collections.deque。
  • 需要有序映射的特殊操作、计数或默认值时可查阅 collections,但先理解基本 dict。
打开本章完整示例与独立阅读页 →
Python 基础条件、循环与程序流程准确理解 if、for、while、range、break、continue 和循环嵌套,而不是背代码模板。

正式定义

控制流决定下一条要执行的语句。分支依据布尔条件选择路径;循环在满足规则时重复执行代码块。Python 用冒号和缩进界定代码块。

必须掌握

  • if/elif/else 从上到下判断,只执行第一个为真的分支;else 不写条件。
  • for 依次取得可迭代对象中的元素;range(start, stop, step) 包含 start、不包含 stop,step 不能为 0。
  • while 在每轮开始前检查条件;循环体必须让状态向终止条件推进。
  • break 结束最内层循环,continue 跳过本轮剩余语句,循环的 else 仅在没有被 break 终止时执行。
  • 嵌套循环的总执行次数通常需要把各层次数相乘;内层 break 不会结束外层循环。
  • 边界测试至少覆盖空范围、单个元素、第一项命中、最后一项命中和始终不命中。

常见误区

  • range 的右端点多算或少算一次
  • while 忘记更新状态造成死循环
  • 把两个互斥条件写成两个独立 if
  • 误以为 break 会跳出所有嵌套循环

适用边界

  • 流程图是算法的表示方法,不是 Python 语法。
  • 递归也能表达重复,但有调用开销和递归深度限制,不能无条件代替循环。
打开本章完整示例与独立阅读页 →

完成检查

确认自己会解释、会编写、会验证