1、存储方式
物理上把topic分成一个或多个patition(对应 server.properties 中的num.partitions=3配置),每个patition物理上对应一个文件夹(该文件夹存储该patition的所有消息和索引文件),如下
[[email protected] logs]$ ll
drwxrwxr-x. 2 victor victor 4096 3月 6 14:37 first-0
drwxrwxr-x. 2 victor victor 4096 3月 6 14:35 first-1
drwxrwxr-x. 2 victor victor 4096 3月 6 14:37 first-2
[[email protected] logs]$ cd first-0
[[email protected] first-0]$ ll
-rw-rw-r--. 1 victor victor 10485760 3月 6 14:33 00000000000000000000.index
-rw-rw-r--. 1 victor victor 219 3月 6 15:07 00000000000000000000.log
-rw-rw-r--. 1 victor victor 10485756 3月 6 14:33 00000000000000000000.timeindex
-rw-rw-r--. 1 victor victor 8 3月 6 14:37 leader-epoch-checkpoint
2、存储策略
无论消息是否被消费,kafka都会保留所有消息。有两种策略可以删除旧数据
[[email protected] logs]$ cd /opt/module/kafka/config
[[email protected] config]$ vim server.properties
? log.retention.hours
1)基于时间:log.retention.hours=168 (一周)
2)基于大小:log.retention.bytes=1073741824 (1G)
需要注意的是,因为Kafka读取特定消息的时间复杂度为O(1),即与文件大小无关,所以这里删除过期文件与提高 Kafka 性能无关。
3、Zookeeper存储结构
尖叫提示:producer不在zookeeper中注册,消费者在zookeeper中注册。