【问题标题】:msghdr behavior using Netlink to communicate between kernel space and user spacemsghdr 行为使用 Netlink 在内核空间和用户空间之间进行通信
【发布时间】:2017-01-05 17:08:43
【问题描述】:

我目前正在为一个学校项目开发一个 linux 内核模块,其中涉及将内核哈希表实现暴露给用户空间。

为了实现这一点,我还创建了一个用户空间 API,它通过 Netlink 套接字与 LKM 进行通信。

我现在确实可以使用它,但我遇到了一个让我很困惑的颠簸,我真的无法绕开我的头。在阅读了所有文档之后,这真的没有帮助我理解问题,并且“走下兔子洞”并查看了 Netlink 的源代码,我想我会在这里问这个问题,看看是否有人可以知道发生了什么以及为什么会发生这种情况。

因此,为了隔离问题,我创建了一个运行通用 Netlink 用户空间和内核空间通信示例的小型测试程序。通过这个,我将展示用户空间程序的 3 个小变体,它们都有不同的行为,我想知道的正是这种行为。

首先是内核模块,这对于所有 3 个变体都是相同的:

#include <linux/module.h>
#include <net/sock.h> 
#include <linux/netlink.h>
#include <linux/skbuff.h> 
#define NETLINK_USER 31

struct sock *nl_sk = NULL;

static void hello_nl_recv_msg(struct sk_buff *skb){

    struct nlmsghdr *nlh;
    int pid;
    struct sk_buff *skb_out;
    int msg_size;
    char *msg = "Hello from kernel";
    int res;

    printk(KERN_INFO "Entering: %s\n", __FUNCTION__);

    msg_size = strlen(msg);

    nlh = (struct nlmsghdr *)skb->data;
    printk(KERN_INFO "Netlink received msg payload:%s\n", (char *)nlmsg_data(nlh));
    pid = nlh->nlmsg_pid; //pid of sending process

    skb_out = nlmsg_new(msg_size, 0);
    if (!skb_out) {
        printk(KERN_ERR "Failed to allocate new skb\n");
        return;
    }

    nlh = nlmsg_put(skb_out, 0, 0, NLMSG_DONE, msg_size, 0);
    NETLINK_CB(skb_out).dst_group = 0; // not in mcast group 
    strncpy(nlmsg_data(nlh), msg, msg_size);

    res = nlmsg_unicast(nl_sk, skb_out, pid);
    if (res < 0)
        printk(KERN_INFO "Error while sending bak to user\n");
}

static int __init hello_init(void){

    struct netlink_kernel_cfg cfg = {
        .input = hello_nl_recv_msg,
    };
    printk(KERN_INFO "Loading kernel module\n");
    nl_sk = netlink_kernel_create(&init_net, NETLINK_USER, &cfg);
    if (!nl_sk) {
        printk(KERN_ALERT "Error creating socket.\n");
        return -10;
    }

    return 0;
}

static void __exit hello_exit(void){

    printk(KERN_INFO "exiting hello module\n");
    netlink_kernel_release(nl_sk);
}

module_init(hello_init); module_exit(hello_exit);

MODULE_LICENSE("GPL");

然后是用户空间程序:

#include <sys/socket.h>
#include <linux/netlink.h>
#include <stdio.h>
#include <stdlib.h>
#include <unistd.h>
#include <string.h>

#define NETLINK_USER 31

#define MAX_PAYLOAD 1024 /* maximum payload size*/

struct msghdr msg;

int main(){
    struct sockaddr_nl src_addr, dest_addr;
    struct nlmsghdr *nlh = NULL;
    struct iovec iov;
    int sock_fd;
    sock_fd = socket(PF_NETLINK, SOCK_RAW, NETLINK_USER);
    if (sock_fd < 0)
        return -1;

    memset(&src_addr, 0, sizeof(src_addr));
    src_addr.nl_family = AF_NETLINK;
    src_addr.nl_pid = getpid(); /* self pid */

    bind(sock_fd, (struct sockaddr *)&src_addr, sizeof(src_addr));

    memset(&dest_addr, 0, sizeof(dest_addr));
    memset(&dest_addr, 0, sizeof(dest_addr));
    dest_addr.nl_family = AF_NETLINK;
    dest_addr.nl_pid = 0; /* For Linux Kernel */
    dest_addr.nl_groups = 0; /* unicast */

    nlh = (struct nlmsghdr *)malloc(NLMSG_SPACE(MAX_PAYLOAD));
    memset(nlh, 0, NLMSG_SPACE(MAX_PAYLOAD));
    nlh->nlmsg_len = NLMSG_SPACE(MAX_PAYLOAD);
    nlh->nlmsg_pid = getpid();
    nlh->nlmsg_flags = 0;

    strcpy(NLMSG_DATA(nlh), "Hello");

    iov.iov_base = (void *)nlh;
    iov.iov_len = nlh->nlmsg_len;
    msg.msg_name = (void *)&dest_addr;
    msg.msg_namelen = sizeof(dest_addr);
    msg.msg_iov = &iov;
    msg.msg_iovlen = 1;

    printf("Sending message to kernel\n");
    sendmsg(sock_fd, &msg, 0);
    printf("Waiting for message from kernel\n");

    /* Read message from kernel */
    recvmsg(sock_fd, &msg, 0);
    printf("Received message payload: %s\n", (char*)NLMSG_DATA(nlh));
    close(sock_fd);
    return 0;
}

现在如果我运行它,一切都很好,它给了我控制台输出:

Sending message to kernel
Waiting for message from kernel
Received message payload: Hello from kernel

以及来自 dmesg 的内核日志输出:

[ 3160.679609] exiting hello module
[ 3165.140816] Loading kernel module
[ 3169.678258] Entering: hello_nl_recv_msg
[ 3169.678260] Netlink received msg payload:Hello

但是对于这个项目,我们正在使用多线程应用程序调用 API,所以我想尝试给每个调用线程一个自己的 Netlink 套接字。为此,我必须这样做

struct msghdr msg;

到本地声明的变量中。

出现问题

当我把它移到主函数中时,事情立刻就坏了。这是因为内核甚至没有进入 Netlink 回调函数,所以我猜用户空间程序甚至无法写入它,但它仍然从 sendmsg() 函数返回正确的写入字节数。

这是在本地声明 msghdr 时向控制台输出的内容:

Sending message to kernel
Waiting for message from kernel

然后它挂起,需要进行 SIGINT 处理,内核日志没有显示任何关于 LKM 接收任何数据的信息。

所以我开始怀疑它是否可能是在本地声明时发生的寻址错误,所以为了尝试一下,我将 msghdr 转换为本地范围内的动态分配指针,你知道吗,它起作用了! 它提供了与原始示例相同的控制台和内核日志输出。

太棒了,我的实际问题确实是出于教育目的并了解它为什么会这样。

为什么全局声明的变量可以工作,而本地声明的变量却不行?

此外,为什么本地声明的、动态分配的指针可以工作?

我在这里缺少基本层面的东西吗?

TL;DR:

为什么在用户空间程序中本地声明 msghdr 结构不起作用,而全局声明或本地动态指针却可以?

【问题讨论】:

    标签: c linux linux-kernel netlink userspace


    【解决方案1】:

    也许当它在堆栈上时,它的内存没有归零,并且您在某些字段中有垃圾。

    【讨论】:

    • 这也是我想过的,但真的想不出一个好的测试方法。有什么建议吗?
    • 在设置任何字段之前尝试memset(&amp;msg, 0, sizeof(msg));
    • 当然,我应该知道这样做..我很愚蠢..哈哈。我会试一试,然后告诉你进展如何。
    • 成功了!我不敢相信我实际上没有尝试过,现在感觉真的很愚蠢..哈哈。谢谢! :)
    • @AbhishekSagar 请重新措辞以使您的评论更有帮助并减少粗鲁的印象 - 甚至对您自己也是如此。
    猜你喜欢
    • 2012-07-15
    • 2011-03-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-05-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多