人文社科 × 数据科学 × AI:数字人文与计算社会科学

2505 字
13 分钟
人文社科 × 数据科学 × AI:数字人文与计算社会科学
人文社科 × 数据科学 × AI:数字人文与计算社会科学

📖 一个中文系学生的”跨界”#

小雅是北京大学中文系的研究生,研究方向是”宋代文人社交网络”。在传统的做法里,她要翻遍宋人笔记和书信集,手动记录”A跟B有交往”——然后画出关系图。光整理资料就花了半年。

2025年,她的导师建议她试试NLP(自然语言处理)方法。小雅学了两个月Python,用NLP工具从《全宋文》中自动提取人名和关系。AI+Python用了3天做了她原计划半年的事——从百万字文献中识别出了超过5000个人物实体和3万多条人物关系。

更妙的是,AI发现了几个她在手动阅读时完全没注意到的人物关联——后来的历史考证证明AI的发现是对的。小雅2026年毕业时,同时拿到了北大读博的录取通知书和一家科技公司”数字人文研究员”的offer(年薪35万)。

“以前所有人都告诉我’中文系跟代码没关系’。现在我反而觉得,能用计算工具处理海量文本,才是研究宏大课题的唯一办法。“——小雅


1. 文科生为什么突然”吃香”了?#

2025-2026年出现的几个重要变化:

  • 大模型改变了门槛——你不需要会C++,只需要会写自然语言的Prompt就能调用AI能力
  • 内容产业的爆发——抖音、小红书、B站的内容生态需要大量既懂内容又懂数据的”文艺+分析”复合人才
  • AI公司发现了一个问题——纯技术人员做出来的AI产品太”冷”了。AI需要”人性”——需要懂语言学的人在调Prompt,需要懂心理学的人在做用户体验,需要懂社会学的人在做AI伦理
  • 数字人文从一个”小众学术领域”变成了一个”产业方向”

💡 一个很有意思的数据:2025-2026年,大模型公司的”Prompt工程师”和”AI训练师”岗位中,文科背景的候选人占比从5%升到了35%。因为写Prompt的本质是语言和逻辑,不是代码。


2. 三个”文科+AI”走出来的案例#

案例一:一位北大语言学博士的AI公司创业#

林博士2024年从北大语言学博士毕业。她的研究课题是”现代汉语的语用规律”——说出来很学术,其实就是”人在什么场合说什么话有什么规律”。

她毕业后没去高校,而是跟两个程序员朋友创办了一家AI公司,专门为电商客服AI做”语用层优化”。普通客服AI的回答虽然语法正确,但听起来像机器人——生硬、不亲切。林博士做的事情是”让人工客服AI说得更像人”——知道什么时候该用”啦”、什么时候该用”呢”,知道面对投诉的客户先说”我理解您的心情”而不是直接念解决方案。

她一年内签下了超过50家企业客户,包括两家头部电商平台。2025年公司营收超过2000万。

案例二:小红书内容数据专家——“用数据读懂人心”#

小红书2025年招聘了超过30名”内容数据专家”——**大多数是社会学、传播学、人类学、心理学背景,而不是计算机背景。**他们的工作是:用数据分析用户在讨论什么、为什么关心这个话题、情绪从哪来、趋势会往哪走。

比如2025年”City Walk(城市漫步)“在小红书引爆——内容数据专家早在两个月前就通过语义分析发现了这个趋势的萌芽,并分析了引爆它的关键人群(一线城市28-35岁职场女性)。品牌方根据这些洞察提前布局内容,抓住了一波红利。

**这些岗位的薪资中位数:月薪2万-4万。**不比程序员低。

案例三:《永乐大典》数字化——让千年文献”开口说话”#

2025年,国家图书馆与字节跳动合作,启动了一个宏大的数字人文项目:将《永乐大典》(明朝编纂的世界上最大百科全书,存世约400册)进行AI数字化处理。AI做的工作包括:

  • 古籍OCR识别(草书、行书、楷书混合,比现代印刷体难百倍)
  • 自动标点、断句
  • 实体识别——自动标注文中的人名、地名、书名、官职名
  • 跨文本关联——将大典中的内容与同时代其他文献中的相关内容关联

**这个项目的团队里:计算机专家占40%,文献学/历史学专家占60%。**纯技术团队做不了这个——因为他们看不懂古文;纯文献学团队也做不了——因为他们不知道AI能怎么用。


3. 人文社科×技术的前景地图#

方向说明需求薪资区间
AI内容策略师为AI生成内容定调性、设规则爆发增长20K-45K
Prompt工程师设计AI对话的提示词和交互逻辑快速增长18K-40K
内容数据分析师分析社交媒体趋势和用户洞察极度紧缺18K-35K
AI伦理研究员确保AI系统公平、安全、合规新兴刚需25K-60K
数字人文研究员用计算工具做人文研究前沿稀缺15K-50K+

🎯 核心逻辑:AI越聪明,越需要”懂人”的人。因为AI能生成内容,但不知道内容好不好、合适不合适、符不符合人性。这个判断力,恰恰是文科生的核心能力。


4. 入门实战:做一些很”文科”但很”AI”的事#

4.1 用Python分析一部小说的情感曲线#

# 分析《活着》全书的情感变化——从苦难到希望
# 不需要你写复杂的NLP算法,用简单的情感词典即可
import re
# 正面情感词和负面情感词的简单词典
positive_words = {'幸福','快乐','温暖','希望','笑容','美好','团圆','满足','安宁',
'坚强','乐观','勇敢','善良','热爱'}
negative_words = {'痛苦','悲伤','绝望','死亡','哭泣','贫穷','饥饿','孤独','压抑',
'恐惧','愤怒','残酷','凄凉','折磨','苦难'}
# 读《活着》全文
with open('活着.txt', 'r', encoding='utf-8') as f:
text = f.read()
# 按章节或按5000字为一个窗口,计算情感密度
window_size = 5000
results = []
for i in range(0, len(text), window_size):
chunk = text[i:i + window_size]
pos_count = sum(chunk.count(w) for w in positive_words)
neg_count = sum(chunk.count(w) for w in negative_words)
if pos_count + neg_count > 0:
sentiment = (pos_count - neg_count) / (pos_count + neg_count)
else:
sentiment = 0
results.append({
'段落': i // window_size + 1,
'正面词数': pos_count,
'负面词数': neg_count,
'情感得分': round(sentiment, 3)
})
# 输出情感曲线
print("📈 《活着》全书情感变化(数值越正越积极,越负越沉重):")
for r in results:
bar = '█' * abs(int(r['情感得分'] * 50)) if r['情感得分'] > 0 else '░' * abs(int(r['情感得分'] * 50))
side = '😊' if r['情感得分'] > 0 else '😢' if r['情感得分'] < 0 else '😐'
print(f" 第{r['段落']}段 {side} "
f"情感{r['情感得分']:+.2f} (正面{r['正面词数']} 负面{r['负面词数']}) {bar}")

4.2 用AI做历史文本分析#

# 场景:你有一篇出土文献的拓片文字,想请AI帮你翻译和解读
ancient_text = """
(这是一段汉代简牍文字,你让AI帮你解读)
"""
prompt = f"""你是古文字学和秦汉史专家。请解读以下出土文献:
文献内容:
{ancient_text}
请提供:
1. 释文(将古文字转写为现代繁体字)
2. 白话翻译(用初中生也能看懂的话)
3. 历史背景(这份文献写于什么时代?发生了什么事?)
4. 学术价值(对秦汉史研究有什么意义?)
5. 趣味点(讲一件这份文献揭示的有趣的历史细节)
语言风格:像一个很会讲历史故事的朋友,不要学术腔。"""
# response = openai_client.chat.completions.create(...)

5. 写给文科同学的最后几句话#

🌟 你不需要成为程序员。你永远不需要。

但你可以学会用AI和简单的代码,把那些别人觉得”太宏大、没法做”的问题变得可操作——研究1000年的文学演变、分析100万条社会情绪、挖掘一个时代的思想图谱。

过去这些研究需要一整个团队、几十年时间。现在你加一台电脑就够了。

编程和AI只是工具,**就像计算器是数学的工具,显微镜是生物学的工具,望远镜是天文学的工具。**它们把门槛降低,让更多普通人能够去探索那些曾经只属于精英学者的宏大问题。

你不用变成程序员。你只需要学会驾驶这辆”AI快车”——方向盘在你手里,目的地你来定。技术只是让你更快到达。」

入门路径——文科生友好版:

  • 第1个月:玩ChatGPT/Claude,学会写好的Prompt。感受一下”跟AI正确沟通”是一门手艺。
  • 第2-3个月:学Python最基础的部分——变量、列表、for循环、字符串处理。目标是用Python处理文本文件。
  • 第4-5个月:学pandas,目标是能用Python做”关键词统计""情感分析""文本分类”这类文本分析任务。
  • 第6个月:做一个小项目——分析你最爱的一部小说、分析一个热门事件的网络舆论、分析一位诗人的用词习惯变迁。做一个有趣的东西,而不是去写枯燥的作业。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

人文社科 × 数据科学 × AI:数字人文与计算社会科学
https://www.yanghanqing.top/posts/digital-humanities-ai/
作者
杨翰卿
发布于
2026-05-13
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
杨翰卿
用工程实践连接软件、硬件、AI 与真实行业。
YHQ LAB
记录项目、学习路线与方法论,把代码写进真实问题里。
分类
标签
最新动态
站点统计
文章
28
分类
2
标签
32
总字数
46,641
运行时长
0 天
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.16.8
文章许可
CC BY-NC-SA 4.0
文章目录