1. 进程与线程的区别
进程是一个正在运行程序的实例,拥有一个独立的逻辑控制流,它提供一个假象好像程序独占的使用处理器,拥有一个私有的地址空间,好像程序独占的使用内存。
1) 调度:进程作为资源拥有的基本单位,线程是调度的基本单位,使得线程基本上不拥有资源,这样可以提供系统的并发程度。
2) 并发性:引入线程使得操作系统具有更好的并发性。
3) 拥有资源:进程是系统拥有资源的基本单位,包括地址空间、全局变量、文件描述符、信号与信号处理程序等,线程拥有极少的资源:程序计数器、寄存器、堆栈、状态、信号屏蔽字等,线程可以共享进程的资源。
4) 系统开销:创建或撤销进程时,系统要为进程创建和回收进程控制块,分配和回收资源,为此操作系统所付出的开销大于线程的创建和回收。在进程切换中,需要保存当前进程的CPU环境,设置新调度运行进程的CPU环境,线程切换只需要保存少量寄存器的内容,不涉及内存方面的操作。因此从切换角度而言,进程的开销大于线程。
2. 多线程的优点与缺点
1) 多进程共享数据简单,但是同步复杂。
2) 占用的内存少,切换简单,CPU利用率高。
3) 创建、销毁简单,速度更快。
4) 编程复杂,调试复杂;一个线程挂掉将导致整个进程挂掉。
5) 适合多核分布式。
3. 多进程的优点与缺点
1) 数据共享复杂,需要IPC;数据是独立的,同步简单。
2) 占用内存多,切换复杂,CPU利用率高。
3) 创建销毁切换复杂,速度慢。
4) 编程简单,调试简单。
5) 进程间不会相互影响。
6) 适合多核多机分布式。
1)需要频繁创建销毁的优先用线程
这种原则最常见的应用就是Web服务器了,来一个连接建立一个线程,断了就销毁线程,要是用进程,创建和销毁的代价是很难承受的
2)需要进行大量计算的优先使用线程
所谓大量计算,当然就是要耗费很多CPU,切换频繁了,这种情况下线程是最合适的。
这种原则最常见的是图像处理、算法处理。
3)强相关的处理用线程,弱相关的处理用进程
什么叫强相关、弱相关?理论上很难定义,给个简单的例子就明白了。
一般的Server需要完成如下任务:消息收发、消息处理。“消息收发”和“消息处理”就是弱相关的任务,而“消息处理”里面可能又分为“消息解码”、“业务处理”,这两个任务相对来说相关性就要强多了。因此“消息收发”和“消息处理”可以分进程设计,“消息解码”、“业务处理”可以分线程设计。
当然这种划分方式不是一成不变的,也可以根据实际情况进行调整。
4)可能要扩展到多机分布的用进程,多核分布的用线程
原因请看上面对比。
5)都满足需求的情况下,用你最熟悉、最拿手的方式
至于“数据共享、同步”、“编程、调试”、“可靠性”这几个维度的所谓的“复杂、简单”应该怎么取舍,我只能说:没有明确的选择方法。但我可以告诉你一个选择原则:如果多进程和多线程都能够满足要求,那么选择你最熟悉、最拿手的那个。
需要提醒的是:虽然我给了这么多的选择原则,但实际应用中基本上都是“进程+线程”的结合方式,千万不要真的陷入一种非此即彼的误区