教程建议 35 分钟学习等级 3/8

PYTHON LESSON 038

选课去重机

掌握集合去重与交并差运算,会用 set 解决重复数据问题。

00 · 学习目标

这一课要解决什么?

先想一想报名表里小明出现了三次,实际到场人数该怎么数?
完成任务社团报名统计器
学习顺序定义 → 语法 → 最小实例 → 独立练习

学完后,你应该能够

  • set(列表) 一键去重
  • A & B 交集、A - B 差集
  • len(集合) 统计不重复个数

01 · 核心概念

集合的应用

集合的应用:set 像一位严格的门卫:同一个值想进两次?没门。把列表丢进 set(),重复元素自动消失,6 条报名记录瞬间变成 4 个不重复学号。

考级对应GESP Python 3 级 · 集合的应用GESP Python 3 级 · 常用内置函数
学习边界

大量从队首删除时 list.pop(0) 是 O(n),应使用 collections.deque。

02 · 语法与规则

先记住这 3 条,再开始写程序

01set(列表) 一键去重

先准确读出这条写法的结构与作用。

02A & B 交集、A - B 差集

换一组最小数据,手工推演一次结果。

03len(集合) 统计不重复个数

再用边界值或反例确认它的适用条件。

03 · 完整实例

代码、运行结果和解释放在一起看

set-course-dedup.pyPYTHON 3.12
# 选课去重机:集合的魔法
sign_up = [105, 101, 103, 105, 101, 108]   # 报名的是学号

unique = set(sign_up)
print("原始报名单:", sign_up)
print("去重之后:", sorted(unique))
print("实际报名人数:", len(unique))

robot = {103, 101, 110}
print("两个社团都报名:", sorted(unique & robot))
print("只报了编程课:", sorted(unique - robot))
运行结果OUTPUT
原始报名单: [105, 101, 103, 105, 101, 108]
去重之后: [101, 103, 105, 108]
实际报名人数: 4
两个社团都报名: [101, 103]
只报了编程课: [105, 108]

集合不保证顺序,所以打印时用 sorted() 排好序,结果稳定又好看。

在新标签运行和修改这个实例已装入本课代码 · 可自定义输入 · 可提交判题

04 · 逐步理解

每一步只解决一个问题

  1. 01

    集合:天生不重复的容器

    set 像一位严格的门卫:同一个值想进两次?没门。把列表丢进 set(),重复元素自动消失,6 条报名记录瞬间变成 4 个不重复学号。

    PYTHON
    unique = set(sign_up)
  2. 02

    去重的经典套路

    “列表 → set → 想要列表再转回来”是去重的标准三连:set(sign_up) 去重,list() 转回列表,sorted() 顺便排序。记住这个套路,以后遇到重复数据就有武器了。

    PYTHON
    print(sorted(set(sign_up)))
  3. 03

    交集 &:两边都有

    unique & robot 找出既报编程课又报机器人社的同学。交集就像两个圆的重叠部分,找“共同好友”“共同选课”都用它。

    PYTHON
    print(sorted(unique & robot))
  4. 04

    差集 - 与并集 |

    unique - robot 是报了编程课但没报机器人社的同学;unique | robot 是两个社团的全部成员(不重复)。交、并、差三种运算,覆盖了“同时、或者、排除”三种常见需求。

    PYTHON
    print(sorted(unique - robot))
    print(sorted(unique | robot))
  5. 05

    集合为什么不保证顺序

    集合只关心“有没有”,不关心“排第几”,所以不能按下标取值,打印出来的顺序也不固定。需要顺序时,请出 sorted() 把它变成有序列表。这也是考试常考的“坑”。

    PYTHON
    print(sorted(unique))
  6. 06

    生活里的集合

    统计全班去过的城市(去重)、找出两个班都参加竞赛的同学(交集)、列出只报了美术班的同学(差集)……试着用今天的知识各写三行代码解决。

05 · 练习与检验

自己写出来,才算真正学会

本课实作步骤
  1. 1运行程序,看懂去重与集合运算
  2. 2在报名单里再加几个重复学号
  3. 3把 robot 社团换成自己班的社团名单
  4. 4试试 A | B 并集,理解三种运算的区别
打开本课编程实验室编辑、运行、测试、判题都在一个页面完成

06 · 完整知识

继续理解定义、规则和适用边界

第一次学习先完成上面的六个步骤;需要查定义、核对规则、分析误区或理解“为什么”时,再展开对应知识章。

核心数据结构列表、元组、字典与集合按顺序、可变性、唯一性和查找需求选择容器,并掌握遍历、推导式、排序与复制。

正式定义

容器保存多个对象。list 是可变有序序列,tuple 是不可变有序序列,dict 保存唯一键到值的映射,set 保存无序且不重复的可哈希对象。

必须掌握

  • list 支持下标、切片、append、extend、insert、pop、remove 与 sort;多数修改方法返回 None。
  • tuple 的逗号比括号更关键,单元素元组必须写成 (value,)。
  • dict 保持插入顺序;键必须可哈希且唯一,get 可提供缺省值,items 同时遍历键和值。
  • set 用于去重与集合运算:| 并、& 交、- 差、^ 对称差;空集合必须写 set()。
  • enumerate 同时给出序号和值,zip 并行遍历多个可迭代对象,默认在最短输入处停止。
  • 浅复制只复制最外层容器;嵌套可变对象仍可能共享。

CORE CONTAINER METHODS

四类核心容器方法完整速查

修改型方法多数返回 None;表中“浅复制”不会递归复制内部可变对象。

list、tuple、dict、set 的公开核心方法
类型方法核心作用
listappend(x)末尾加入一个对象
listextend(iterable)末尾加入可迭代对象的每一项
listinsert(i, x)在下标 i 前插入
listremove(x)删除第一个等于 x 的元素,不存在时报错
listpop([i])删除并返回指定项,默认末项
listclear()删除全部元素
listindex(x[, start[, stop]])返回第一个匹配下标
listcount(x)统计等于 x 的元素数
listsort(*, key=None, reverse=False)稳定地原地排序
listreverse()原地逆序
listcopy()浅复制列表
tuplecount(x)统计元素次数
tupleindex(x[, start[, stop]])返回第一个匹配下标
dictclear()删除全部键值对
dictcopy()浅复制字典
dictfromkeys(iterable[, value])用一组键创建新字典
dictget(key[, default])安全取值,缺键返回默认值
dictitems()键值对动态视图
dictkeys()键动态视图
dictpop(key[, default])删除键并返回值
dictpopitem()删除并返回最后加入的键值对
dictsetdefault(key[, default])缺键时写入默认值并返回
dictupdate(other)用映射或键值对更新
dictvalues()值动态视图
setadd(x)加入一个元素
setclear()删除全部元素
setcopy()浅复制集合
setdiscard(x)删除元素,不存在也不报错
setremove(x)删除元素,不存在时报错
setpop()删除并返回任意元素
setunion(*others)返回并集
setupdate(*others)用并集原地更新
setintersection(*others)返回交集
setintersection_update(*others)用交集原地更新
setdifference(*others)返回差集
setdifference_update(*others)用差集原地更新
setsymmetric_difference(other)返回对称差
setsymmetric_difference_update(other)用对称差原地更新
setissubset(other)是否为子集
setissuperset(other)是否为超集
setisdisjoint(other)是否没有共同元素

常见误区

  • 把 list.sort() 的返回值赋回列表
  • 遍历 dict 时同时改变其大小
  • 用可变 list 当字典键
  • 把 set 当成有固定顺序的序列

适用边界

  • 大量从队首删除时 list.pop(0) 是 O(n),应使用 collections.deque。
  • 需要有序映射的特殊操作、计数或默认值时可查阅 collections,但先理解基本 dict。
打开本章完整示例与独立阅读页 →
算法方法算法、复杂度与解题验证把题意转成输入、状态、规则与输出,用正确性和复杂度共同评价解法。

正式定义

算法是解决一类问题的有限、明确步骤。正确性说明算法对所有满足前置条件的输入都得到规定结果;时间和空间复杂度描述输入规模增长时资源使用的增长量级。

必须掌握

  • 先明确输入规模 n、数据范围、目标和允许误差,再选择数据结构与算法。
  • O(1)、O(log n)、O(n)、O(n log n)、O(n²)、O(2ⁿ) 表示增长量级,不是精确运行秒数。
  • 顺序代码复杂度取较大项,嵌套循环常相乘,二分每步把范围缩小一半。
  • 正确性可用循环不变量、数学归纳、交换论证、反证或状态定义来说明。
  • 样例只验证少量输入;必须自己设计边界、极端、重复、有序/逆序和无解数据。
  • 优化前先得到正确基线并测量瓶颈,不为小数据盲目增加复杂实现。

常见误区

  • 只看样例通过就宣称正确
  • 不看数据范围使用 O(n²)
  • 二分区间开闭混用
  • 把 O(n) 当成永远比 O(log n) 慢固定倍数

适用边界

  • 复杂度隐藏常数与硬件差异,但仍是比较规模增长的核心工具。
  • 考场策略、课程完成度和算法能力是不同证据,任何单项都不能保证考级通过。
打开本章完整示例与独立阅读页 →
Python 基础运算符、表达式与优先级完整区分算术、比较、逻辑、成员、身份和位运算,并用优先级表消除歧义。

正式定义

表达式求值得到一个值。运算符规定如何组合操作数;当一个表达式含多个运算符时,优先级和结合方向决定求值顺序,括号可以明确改变顺序。

必须掌握

  • / 总是得到浮点结果;// 是向负无穷方向取整的整除;% 与 // 满足 a == (a // b) * b + a % b。
  • 比较可以链式书写,如 0 <= x < 10;and/or 会短路并返回最后求值的操作数,不一定返回 bool。
  • == 比较值是否相等,is 比较是否为同一个对象;判断 None 应写 is None。
  • in/not in 做成员测试;对 dict 测试的是键。
  • 位运算作用于整数的二进制位;负整数按无限长二进制补码语义理解。
  • 复杂表达式即使能靠优先级正确运行,也应使用括号表达意图。

常见误区

  • 把 // 当成简单截断
  • 用 is 比较数字或字符串的值
  • 忘记 and 的优先级高于 or
  • 连续位移、比较和逻辑运算却不加括号

适用边界

  • 浮点数比较受二进制表示误差影响,需要按问题选择容差。
  • 运算符可由自定义类重载,因此相同符号对不同类型可能有不同语义。
打开本章完整示例与独立阅读页 →
完整速查Python 关键字、内置名称与语法速查集中查阅 Python 3.12 的 35 个硬关键字、4 个软关键字和课程常用内置函数,避免知识碎片化。

正式定义

关键字是 Python 语法保留的词,不能作为普通标识符;软关键字只在特定语法位置有特殊含义。内置名称由 builtins 模块提供,可以直接使用,但仍可能被同名变量遮蔽。

必须掌握

  • Python 3.12 有 35 个硬关键字;False、None、True 首字母大写。
  • match、case、_、type 是软关键字,只在对应模式匹配或类型参数语法环境中特殊。
  • 内置函数无需 import,但不要把变量命名为 list、str、sum、max、input 等。
  • help(name) 查看运行时帮助,dir(object) 查看可用名称,type(object) 查看类型。
  • 内置异常类也是内置名称;捕获异常时应使用具体异常类型。
  • 本站课程运行基线是 Python 3.12,跨版本新增语法必须先核对目标运行环境。

常见误区

  • 把内置名称误称为关键字
  • 用 list = [] 遮蔽 list()
  • 照搬其他 Python 版本的关键字表
  • 见到陌生函数名就假定无需导入

适用边界

  • 本页完整列出语言关键字,并列出课程实际依赖的内置函数;Python 的全部内置异常类和对象协议应按具体错误与主题查阅。
  • 第三方库 API 不属于 Python 语言本身,也不属于内置名称。
打开本章完整示例与独立阅读页 →

完成检查

确认自己会解释、会编写、会验证