教程建议 35 分钟学习等级 4/8

PYTHON LESSON 050

聊天记录分析器

掌握 split、join、strip、startswith / endswith 与 f-string 格式化,做出聊天记录统计器。

00 · 学习目标

这一课要解决什么?

先想一想几百条聊天记录里,怎样一眼找出谁是最活跃的“发言王”?
完成任务班级群发言统计表
学习顺序定义 → 语法 → 最小实例 → 独立练习

学完后,你应该能够

  • s.split(分隔符) 把字符串切成列表
  • 分隔符.join(列表) 把列表拼回字符串
  • f"{变量}" 在字符串里嵌入变量

01 · 核心概念

split / join / strip / startswith / endswith 与 f-string 格式化

split / join / strip / startswith / endswith 与 f-string 格式化:每条聊天记录都是“名字 : 内容”。split(":") 像一把剪刀,沿英文冒号把字符串剪成两段,正好装进两个变量。这种“一个字符串拆成几个变量”的写法叫解包。

考级对应GESP Python 4 级 · 字符串及其函数GESP Python 4 级 · 字符串格式化(f-string)
学习边界

正则表达式不在低等级字符串必修范围,但复杂模式匹配时应使用 re,而不是堆叠大量 split/find。

02 · 语法与规则

先记住这 3 条,再开始写程序

01s.split(分隔符) 把字符串切成列表

先准确读出这条写法的结构与作用。

02分隔符.join(列表) 把列表拼回字符串

换一组最小数据,手工推演一次结果。

03f"{变量}" 在字符串里嵌入变量

再用边界值或反例确认它的适用条件。

03 · 完整实例

代码、运行结果和解释放在一起看

chat-analyzer.pyPYTHON 3.12
# 班级群聊天记录分析器
chats = [
    "小明 : 今天的数学作业是什么?",
    "小红 : 做第 25 页第 3 题",
    "小明 : 谢谢!",
    "小刚 : 哈哈,我也没写",
    "小红 : 记得明天要听写",
    "小明 : 收到!",
]

names = []
counts = []
for line in chats:
    name, message = line.split(":")   # 按英文冒号切成两半
    name = name.strip()               # 去掉名字两边的空格
    if name in names:
        counts[names.index(name)] = counts[names.index(name)] + 1
    else:
        names.append(name)
        counts.append(1)

print("—— 发言统计表 ——")
for i in range(len(names)):
    bar = "█" * counts[i]
    print(f"{names[i]} | {bar} {counts[i]} 条")

best = names[counts.index(max(counts))]
print("发言王是:", best)
print("名单拼成一句话:", "、".join(names))

exclaim = 0
for line in chats:
    if line.strip().endswith("!"):
        exclaim = exclaim + 1
print("以感叹号结尾的消息:", exclaim, "条")
运行结果OUTPUT
—— 发言统计表 ——
小明 | ███ 3 条
小红 | ██ 2 条
小刚 | █ 1 条
发言王是: 小明
名单拼成一句话: 小明、小红、小刚
以感叹号结尾的消息: 2 条

“█” * 次数 把数字画成条形图,这是 f-string 排版的小魔术。

在新标签运行和修改这个实例已装入本课代码 · 可自定义输入 · 可提交判题

04 · 逐步理解

每一步只解决一个问题

  1. 01

    一行记录,两半信息

    每条聊天记录都是“名字 : 内容”。split(":") 像一把剪刀,沿英文冒号把字符串剪成两段,正好装进两个变量。这种“一个字符串拆成几个变量”的写法叫解包。

    PYTHON
    name, message = line.split(":")
  2. 02

    strip 摘掉多余的空格

    “小明 : ……”剪开后,名字后面拖着一个小尾巴空格。strip() 负责把字符串两端的空白(空格、换行)摘干净,统计时才不会把“小明”和“小明 ”当成两个人。

    PYTHON
    name = name.strip()
  3. 03

    名单去重与计数

    names 列表记录发言顺序,counts 列表按相同位置记条数。名字已在名单里,就用 names.index(name) 找到位置加 1;不在名单里,就 append 进去并记 1 条。

    PYTHON
    if name in names:
        counts[names.index(name)] += 1
    else:
        names.append(name)
        counts.append(1)
  4. 04

    join 把列表拼回字符串

    split 的反向操作是 join:用“、”当胶水,把名单粘成一句话。注意写法是“胶水”.join(列表),胶水在前、列表在后。

    PYTHON
    print("、".join(names))
  5. 05

    startswith / endswith 站岗检查

    endswith("!") 检查字符串是不是以感叹号结尾,startswith 则检查开头。它们回答“是/否”,特别适合做消息筛选,比如找出所有 @老师 的消息。

    PYTHON
    if line.strip().endswith("!"):
        exclaim = exclaim + 1
  6. 06

    f-string 排版小魔术

    f-string 的花括号里可以直接写变量。再配合 “█” * counts[i] 把数字变成小方块,统计表立刻变成直观的条形图——数据可视化,从小小的字符串开始。

    PYTHON
    print(f"{names[i]} | {bar} {counts[i]} 条")

05 · 练习与检验

自己写出来,才算真正学会

本课实作步骤
  1. 1运行分析器,查看发言统计表
  2. 2给记录再添两位同学的发言
  3. 3用 endswith 统计感叹号消息
  4. 4把条形图的方块换成别的符号
打开本课编程实验室编辑、运行、测试、判题都在一个页面完成

06 · 完整知识

继续理解定义、规则和适用边界

第一次学习先完成上面的六个步骤;需要查定义、核对规则、分析误区或理解“为什么”时,再展开对应知识章。

编码与文本字符串、转义、切片与格式化从不可变字符序列到检索、拆分、拼接、格式化和常用判断方法。

正式定义

str 是不可变的 Unicode 字符序列。下标访问单个字符,切片生成新字符串;任何看似“修改字符串”的方法都会返回新对象。

必须掌握

  • 下标从 0 开始,负下标从末尾开始;切片 s[start:stop:step] 不包含 stop,step 不能为 0。
  • 转义序列用于在字面量中表示换行、制表、引号、反斜杠或码点;原始字符串仍有末尾反斜杠限制。
  • find 找不到返回 -1,index 找不到抛 ValueError;count 统计不重叠出现次数。
  • split 把字符串拆成列表,join 用一个字符串连接可迭代对象中的字符串,strip 只删除两端字符。
  • f-string 的格式说明可控制宽度、对齐、精度、进制和百分比;格式化不改变原值。
  • isalpha/isdigit 等按 Unicode 定义,不只识别英文字母和 ASCII 数字。

STRING LITERALS

字符串转义序列速查

表中写法用于普通字符串字面量。原始字符串 r'...' 会保留多数反斜杠,但不能以奇数个反斜杠结束。

Python 字符串转义序列
写法含义
\\反斜杠 \
\'单引号
\"双引号
\n换行 LF
\r回车 CR
\t水平制表
\b退格
\f换页
\v垂直制表
\a响铃
\ooo八进制值 ooo 的字符(最多三位)
\xhh十六进制值 hh 的字符(必须两位)
\N{name}按 Unicode 正式名称指定字符
\uxxxx16 位十六进制 Unicode 码点
\Uxxxxxxxx32 位十六进制 Unicode 码点
反斜杠 + 换行忽略物理换行,继续同一逻辑行

STR PUBLIC METHODS

字符串公开方法完整速查

以下覆盖 Python 3.12 str 的公开方法。所有方法都返回结果或判断值,不会原地改变字符串。

Python 3.12 str 公开方法
方法核心作用
capitalize首字符大写,其余字符小写
casefold用于无大小写文本匹配的强力小写化
center按宽度居中并填充
count统计非重叠子串次数
encode按编码方案转为 bytes
endswith判断是否以指定后缀结束
expandtabs把制表符展开为空格
find查找子串,找不到返回 -1
format按格式字段生成字符串
format_map使用映射提供格式字段
index查找子串,找不到抛 ValueError
isalnum是否全为字母或数字且非空
isalpha是否全为字母且非空
isascii是否所有字符码点都小于 128
isdecimal是否全为十进制数字字符且非空
isdigit是否全为数字字符且非空,范围比 isdecimal 广
isidentifier是否可作 Python 标识符的形状
islower是否有大小写字符且都为小写
isnumeric是否全为数值字符且非空,范围比 isdigit 广
isprintable是否全为可打印字符或为空串
isspace是否全为空白字符且非空
istitle是否符合标题式大小写
isupper是否有大小写字符且都为大写
join用当前字符串连接一组字符串
ljust按宽度左对齐并填充
lower转为小写
lstrip删除左端指定字符集合
maketrans创建 translate 使用的转换表
partition按首次分隔符拆成三元组
removeprefix存在指定前缀时删除一次
removesuffix存在指定后缀时删除一次
replace替换子串,可限制次数
rfind从右侧查找,找不到返回 -1
rindex从右侧查找,找不到抛 ValueError
rjust按宽度右对齐并填充
rpartition按最后一次分隔符拆成三元组
rsplit从右侧开始限制拆分次数
rstrip删除右端指定字符集合
split按分隔符拆成列表
splitlines按行边界拆分
startswith判断是否以指定前缀开始
strip删除两端指定字符集合
swapcase交换大小写
title转为标题式大小写
translate按转换表替换或删除字符
upper转为大写
zfill在符号后用 0 补齐宽度

常见误区

  • 尝试 s[0] = 'A' 原地修改字符串
  • 把 strip('ab') 误解为删除完整子串 'ab'
  • find 返回 -1 后直接拿去当有效下标
  • 把字节长度与字符长度混为一谈

适用边界

  • 正则表达式不在低等级字符串必修范围,但复杂模式匹配时应使用 re,而不是堆叠大量 split/find。
  • 面向用户的字符计数还可能涉及组合字符和字素簇,len 统计的是 Unicode 码点序列长度。
打开本章完整示例与独立阅读页 →
Python 基础程序执行、输入输出、变量与数据类型从一条语句怎样执行开始,系统掌握 print、input、变量、对象、类型与显式转换。

正式定义

Python 程序由语句和表达式组成,通常按从上到下的顺序执行。变量名通过赋值绑定到对象;对象有类型和值。input() 始终返回 str,是否转换成 int 或 float 必须由题意决定。

必须掌握

  • print(*objects, sep=' ', end='\n') 可以控制对象之间的分隔符和末尾字符。
  • input(prompt) 读取一行并去掉行末换行符,返回值一定是字符串。
  • 赋值符号 = 建立或更新名字与对象的绑定;== 才是相等比较。
  • 核心标量类型包括 int、float、bool、str 和 NoneType;bool 是 int 的子类,但语义上应当用于真假判断。
  • int、float、str、bool 可做显式类型转换;转换可能失败,不能把任意文本直接当数字。
  • 注释以 # 开始;规范的变量名应表达含义,不能使用关键字。

常见误区

  • 把 input() 的结果直接与整数相加
  • 混淆 = 与 ==
  • 用 float 表示必须精确的十进制金额却不考虑误差
  • 变量名覆盖 print、list 等内置名称

适用边界

  • 课程先讲同步的文本输入输出;文件、网络、图形界面和异步输入分别在对应章节说明。
  • Python 的变量没有固定类型,但对象有类型;这不等于程序可以随意混用类型。
打开本章完整示例与独立阅读页 →
核心数据结构列表、元组、字典与集合按顺序、可变性、唯一性和查找需求选择容器,并掌握遍历、推导式、排序与复制。

正式定义

容器保存多个对象。list 是可变有序序列,tuple 是不可变有序序列,dict 保存唯一键到值的映射,set 保存无序且不重复的可哈希对象。

必须掌握

  • list 支持下标、切片、append、extend、insert、pop、remove 与 sort;多数修改方法返回 None。
  • tuple 的逗号比括号更关键,单元素元组必须写成 (value,)。
  • dict 保持插入顺序;键必须可哈希且唯一,get 可提供缺省值,items 同时遍历键和值。
  • set 用于去重与集合运算:| 并、& 交、- 差、^ 对称差;空集合必须写 set()。
  • enumerate 同时给出序号和值,zip 并行遍历多个可迭代对象,默认在最短输入处停止。
  • 浅复制只复制最外层容器;嵌套可变对象仍可能共享。

常见误区

  • 把 list.sort() 的返回值赋回列表
  • 遍历 dict 时同时改变其大小
  • 用可变 list 当字典键
  • 把 set 当成有固定顺序的序列

适用边界

  • 大量从队首删除时 list.pop(0) 是 O(n),应使用 collections.deque。
  • 需要有序映射的特殊操作、计数或默认值时可查阅 collections,但先理解基本 dict。
打开本章完整示例与独立阅读页 →
程序组织函数、参数、返回值与作用域用明确的输入、输出和职责拆分程序,理解参数绑定、作用域、递归与可变对象。

正式定义

函数把一段可复用行为绑定到名字。调用时实参按规则绑定到形参,函数执行后用 return 交回结果;没有显式 return 时返回 None。名字解析遵循局部、闭包、全局、内置的 LEGB 顺序。

必须掌握

  • 位置参数先于关键字参数;默认值在 def 执行时创建一次,不应直接使用可变容器作默认值。
  • return 立即结束当前函数;return a, b 实际返回一个元组。
  • 函数内赋值默认创建局部变量;global 声明模块级名字,nonlocal 声明最近外层函数名字。
  • 传参传递的是对象引用;函数是否影响调用方取决于对象是否可变以及函数是否原地修改。
  • 递归必须有可到达的终止条件,并要考虑调用深度、重复子问题和栈空间。
  • 纯函数更容易测试;把输入输出、计算逻辑和全局状态分开能显著减少错误。

常见误区

  • 可变默认参数在多次调用间共享
  • 忘记 return 导致得到 None
  • 局部变量遮蔽全局同名变量
  • 递归没有缩小问题规模

适用边界

  • lambda 只能包含一个表达式,适合短小的排序键,不适合塞入复杂业务逻辑。
  • 装饰器、生成器和闭包属于函数模型的进阶应用,应在基本参数与作用域稳定后学习。
打开本章完整示例与独立阅读页 →

完成检查

确认自己会解释、会编写、会验证