PYTHON LESSON 050
聊天记录分析器
掌握 split、join、strip、startswith / endswith 与 f-string 格式化,做出聊天记录统计器。
00 · 学习目标
这一课要解决什么?
学完后,你应该能够
- s.split(分隔符) 把字符串切成列表
- 分隔符.join(列表) 把列表拼回字符串
- f"{变量}" 在字符串里嵌入变量
01 · 核心概念
split / join / strip / startswith / endswith 与 f-string 格式化
split / join / strip / startswith / endswith 与 f-string 格式化:每条聊天记录都是“名字 : 内容”。split(":") 像一把剪刀,沿英文冒号把字符串剪成两段,正好装进两个变量。这种“一个字符串拆成几个变量”的写法叫解包。
GESP Python 4 级 · 字符串及其函数GESP Python 4 级 · 字符串格式化(f-string)正则表达式不在低等级字符串必修范围,但复杂模式匹配时应使用 re,而不是堆叠大量 split/find。
02 · 语法与规则
先记住这 3 条,再开始写程序
s.split(分隔符) 把字符串切成列表先准确读出这条写法的结构与作用。
分隔符.join(列表) 把列表拼回字符串换一组最小数据,手工推演一次结果。
f"{变量}" 在字符串里嵌入变量再用边界值或反例确认它的适用条件。
03 · 完整实例
代码、运行结果和解释放在一起看
# 班级群聊天记录分析器
chats = [
"小明 : 今天的数学作业是什么?",
"小红 : 做第 25 页第 3 题",
"小明 : 谢谢!",
"小刚 : 哈哈,我也没写",
"小红 : 记得明天要听写",
"小明 : 收到!",
]
names = []
counts = []
for line in chats:
name, message = line.split(":") # 按英文冒号切成两半
name = name.strip() # 去掉名字两边的空格
if name in names:
counts[names.index(name)] = counts[names.index(name)] + 1
else:
names.append(name)
counts.append(1)
print("—— 发言统计表 ——")
for i in range(len(names)):
bar = "█" * counts[i]
print(f"{names[i]} | {bar} {counts[i]} 条")
best = names[counts.index(max(counts))]
print("发言王是:", best)
print("名单拼成一句话:", "、".join(names))
exclaim = 0
for line in chats:
if line.strip().endswith("!"):
exclaim = exclaim + 1
print("以感叹号结尾的消息:", exclaim, "条")—— 发言统计表 —— 小明 | ███ 3 条 小红 | ██ 2 条 小刚 | █ 1 条 发言王是: 小明 名单拼成一句话: 小明、小红、小刚 以感叹号结尾的消息: 2 条
“█” * 次数 把数字画成条形图,这是 f-string 排版的小魔术。
04 · 逐步理解
每一步只解决一个问题
- 01
一行记录,两半信息
每条聊天记录都是“名字 : 内容”。split(":") 像一把剪刀,沿英文冒号把字符串剪成两段,正好装进两个变量。这种“一个字符串拆成几个变量”的写法叫解包。
name, message = line.split(":") - 02
strip 摘掉多余的空格
“小明 : ……”剪开后,名字后面拖着一个小尾巴空格。strip() 负责把字符串两端的空白(空格、换行)摘干净,统计时才不会把“小明”和“小明 ”当成两个人。
name = name.strip() - 03
名单去重与计数
names 列表记录发言顺序,counts 列表按相同位置记条数。名字已在名单里,就用 names.index(name) 找到位置加 1;不在名单里,就 append 进去并记 1 条。
if name in names: counts[names.index(name)] += 1 else: names.append(name) counts.append(1) - 04
join 把列表拼回字符串
split 的反向操作是 join:用“、”当胶水,把名单粘成一句话。注意写法是“胶水”.join(列表),胶水在前、列表在后。
print("、".join(names)) - 05
startswith / endswith 站岗检查
endswith("!") 检查字符串是不是以感叹号结尾,startswith 则检查开头。它们回答“是/否”,特别适合做消息筛选,比如找出所有 @老师 的消息。
if line.strip().endswith("!"): exclaim = exclaim + 1 - 06
f-string 排版小魔术
f-string 的花括号里可以直接写变量。再配合 “█” * counts[i] 把数字变成小方块,统计表立刻变成直观的条形图——数据可视化,从小小的字符串开始。
print(f"{names[i]} | {bar} {counts[i]} 条")
05 · 练习与检验
自己写出来,才算真正学会
- 1运行分析器,查看发言统计表
- 2给记录再添两位同学的发言
- 3用 endswith 统计感叹号消息
- 4把条形图的方块换成别的符号
06 · 完整知识
继续理解定义、规则和适用边界
第一次学习先完成上面的六个步骤;需要查定义、核对规则、分析误区或理解“为什么”时,再展开对应知识章。
编码与文本字符串、转义、切片与格式化从不可变字符序列到检索、拆分、拼接、格式化和常用判断方法。+
正式定义
str 是不可变的 Unicode 字符序列。下标访问单个字符,切片生成新字符串;任何看似“修改字符串”的方法都会返回新对象。
必须掌握
- 下标从 0 开始,负下标从末尾开始;切片 s[start:stop:step] 不包含 stop,step 不能为 0。
- 转义序列用于在字面量中表示换行、制表、引号、反斜杠或码点;原始字符串仍有末尾反斜杠限制。
- find 找不到返回 -1,index 找不到抛 ValueError;count 统计不重叠出现次数。
- split 把字符串拆成列表,join 用一个字符串连接可迭代对象中的字符串,strip 只删除两端字符。
- f-string 的格式说明可控制宽度、对齐、精度、进制和百分比;格式化不改变原值。
- isalpha/isdigit 等按 Unicode 定义,不只识别英文字母和 ASCII 数字。
STRING LITERALS
字符串转义序列速查
表中写法用于普通字符串字面量。原始字符串 r'...' 会保留多数反斜杠,但不能以奇数个反斜杠结束。
| 写法 | 含义 |
|---|---|
\\ | 反斜杠 \ |
\' | 单引号 |
\" | 双引号 |
\n | 换行 LF |
\r | 回车 CR |
\t | 水平制表 |
\b | 退格 |
\f | 换页 |
\v | 垂直制表 |
\a | 响铃 |
\ooo | 八进制值 ooo 的字符(最多三位) |
\xhh | 十六进制值 hh 的字符(必须两位) |
\N{name} | 按 Unicode 正式名称指定字符 |
\uxxxx | 16 位十六进制 Unicode 码点 |
\Uxxxxxxxx | 32 位十六进制 Unicode 码点 |
反斜杠 + 换行 | 忽略物理换行,继续同一逻辑行 |
STR PUBLIC METHODS
字符串公开方法完整速查
以下覆盖 Python 3.12 str 的公开方法。所有方法都返回结果或判断值,不会原地改变字符串。
| 方法 | 核心作用 |
|---|---|
capitalize | 首字符大写,其余字符小写 |
casefold | 用于无大小写文本匹配的强力小写化 |
center | 按宽度居中并填充 |
count | 统计非重叠子串次数 |
encode | 按编码方案转为 bytes |
endswith | 判断是否以指定后缀结束 |
expandtabs | 把制表符展开为空格 |
find | 查找子串,找不到返回 -1 |
format | 按格式字段生成字符串 |
format_map | 使用映射提供格式字段 |
index | 查找子串,找不到抛 ValueError |
isalnum | 是否全为字母或数字且非空 |
isalpha | 是否全为字母且非空 |
isascii | 是否所有字符码点都小于 128 |
isdecimal | 是否全为十进制数字字符且非空 |
isdigit | 是否全为数字字符且非空,范围比 isdecimal 广 |
isidentifier | 是否可作 Python 标识符的形状 |
islower | 是否有大小写字符且都为小写 |
isnumeric | 是否全为数值字符且非空,范围比 isdigit 广 |
isprintable | 是否全为可打印字符或为空串 |
isspace | 是否全为空白字符且非空 |
istitle | 是否符合标题式大小写 |
isupper | 是否有大小写字符且都为大写 |
join | 用当前字符串连接一组字符串 |
ljust | 按宽度左对齐并填充 |
lower | 转为小写 |
lstrip | 删除左端指定字符集合 |
maketrans | 创建 translate 使用的转换表 |
partition | 按首次分隔符拆成三元组 |
removeprefix | 存在指定前缀时删除一次 |
removesuffix | 存在指定后缀时删除一次 |
replace | 替换子串,可限制次数 |
rfind | 从右侧查找,找不到返回 -1 |
rindex | 从右侧查找,找不到抛 ValueError |
rjust | 按宽度右对齐并填充 |
rpartition | 按最后一次分隔符拆成三元组 |
rsplit | 从右侧开始限制拆分次数 |
rstrip | 删除右端指定字符集合 |
split | 按分隔符拆成列表 |
splitlines | 按行边界拆分 |
startswith | 判断是否以指定前缀开始 |
strip | 删除两端指定字符集合 |
swapcase | 交换大小写 |
title | 转为标题式大小写 |
translate | 按转换表替换或删除字符 |
upper | 转为大写 |
zfill | 在符号后用 0 补齐宽度 |
常见误区
- 尝试 s[0] = 'A' 原地修改字符串
- 把 strip('ab') 误解为删除完整子串 'ab'
- find 返回 -1 后直接拿去当有效下标
- 把字节长度与字符长度混为一谈
适用边界
- 正则表达式不在低等级字符串必修范围,但复杂模式匹配时应使用 re,而不是堆叠大量 split/find。
- 面向用户的字符计数还可能涉及组合字符和字素簇,len 统计的是 Unicode 码点序列长度。
Python 基础程序执行、输入输出、变量与数据类型从一条语句怎样执行开始,系统掌握 print、input、变量、对象、类型与显式转换。+
正式定义
Python 程序由语句和表达式组成,通常按从上到下的顺序执行。变量名通过赋值绑定到对象;对象有类型和值。input() 始终返回 str,是否转换成 int 或 float 必须由题意决定。
必须掌握
- print(*objects, sep=' ', end='\n') 可以控制对象之间的分隔符和末尾字符。
- input(prompt) 读取一行并去掉行末换行符,返回值一定是字符串。
- 赋值符号 = 建立或更新名字与对象的绑定;== 才是相等比较。
- 核心标量类型包括 int、float、bool、str 和 NoneType;bool 是 int 的子类,但语义上应当用于真假判断。
- int、float、str、bool 可做显式类型转换;转换可能失败,不能把任意文本直接当数字。
- 注释以 # 开始;规范的变量名应表达含义,不能使用关键字。
常见误区
- 把 input() 的结果直接与整数相加
- 混淆 = 与 ==
- 用 float 表示必须精确的十进制金额却不考虑误差
- 变量名覆盖 print、list 等内置名称
适用边界
- 课程先讲同步的文本输入输出;文件、网络、图形界面和异步输入分别在对应章节说明。
- Python 的变量没有固定类型,但对象有类型;这不等于程序可以随意混用类型。
核心数据结构列表、元组、字典与集合按顺序、可变性、唯一性和查找需求选择容器,并掌握遍历、推导式、排序与复制。+
正式定义
容器保存多个对象。list 是可变有序序列,tuple 是不可变有序序列,dict 保存唯一键到值的映射,set 保存无序且不重复的可哈希对象。
必须掌握
- list 支持下标、切片、append、extend、insert、pop、remove 与 sort;多数修改方法返回 None。
- tuple 的逗号比括号更关键,单元素元组必须写成 (value,)。
- dict 保持插入顺序;键必须可哈希且唯一,get 可提供缺省值,items 同时遍历键和值。
- set 用于去重与集合运算:| 并、& 交、- 差、^ 对称差;空集合必须写 set()。
- enumerate 同时给出序号和值,zip 并行遍历多个可迭代对象,默认在最短输入处停止。
- 浅复制只复制最外层容器;嵌套可变对象仍可能共享。
常见误区
- 把 list.sort() 的返回值赋回列表
- 遍历 dict 时同时改变其大小
- 用可变 list 当字典键
- 把 set 当成有固定顺序的序列
适用边界
- 大量从队首删除时 list.pop(0) 是 O(n),应使用 collections.deque。
- 需要有序映射的特殊操作、计数或默认值时可查阅 collections,但先理解基本 dict。
程序组织函数、参数、返回值与作用域用明确的输入、输出和职责拆分程序,理解参数绑定、作用域、递归与可变对象。+
正式定义
函数把一段可复用行为绑定到名字。调用时实参按规则绑定到形参,函数执行后用 return 交回结果;没有显式 return 时返回 None。名字解析遵循局部、闭包、全局、内置的 LEGB 顺序。
必须掌握
- 位置参数先于关键字参数;默认值在 def 执行时创建一次,不应直接使用可变容器作默认值。
- return 立即结束当前函数;return a, b 实际返回一个元组。
- 函数内赋值默认创建局部变量;global 声明模块级名字,nonlocal 声明最近外层函数名字。
- 传参传递的是对象引用;函数是否影响调用方取决于对象是否可变以及函数是否原地修改。
- 递归必须有可到达的终止条件,并要考虑调用深度、重复子问题和栈空间。
- 纯函数更容易测试;把输入输出、计算逻辑和全局状态分开能显著减少错误。
常见误区
- 可变默认参数在多次调用间共享
- 忘记 return 导致得到 None
- 局部变量遮蔽全局同名变量
- 递归没有缩小问题规模
适用边界
- lambda 只能包含一个表达式,适合短小的排序键,不适合塞入复杂业务逻辑。
- 装饰器、生成器和闭包属于函数模型的进阶应用,应在基本参数与作用域稳定后学习。
完成检查