【问题标题】:How to structure stratified data for Poisson regression如何为泊松回归构建分层数据
【发布时间】:2012-12-03 23:44:07
【问题描述】:

我正在尝试使用 R 对我拥有的一些数据进行泊松回归。目前数据结构如下:

数据根据三个职业进行分层。数据中有四个收入水平。在每个阶层内,对于每个收入水平,都有

  1. 已发生的工作场所事故的数量,以及
  2. 观察到的总人月数。

这是一个设置示例。括号内的数字是观察到的总人月数,括号内的数字是工伤事故数。

我的问题是如何设置这些数据并对收入水平对工伤事故发生率的影响进行泊松回归?理想情况下,我想调整职业并找出仅收入的影响,但作为一个起点,我根本不知道如何将其设置为泊松回归问题。我想过做一些事情,比如将受伤次数除以观察月数,但结果是非整数值,所以我认为这不是正确的做法。

重申,预测:收入水平;响应变量:工伤事故。

顺便说一句,如果这样做有意义的话,将括号数字分开并将它们放入自己的列中会很容易。

非常感谢有关如何设置的任何建议。我确信其他统计学家正在使用类似的结构化数据,并且可能也希望获得一些见解。非常感谢!

【问题讨论】:

  • Two cmets:我认为这个问题可能更适合stats.stackexchange.com 本网站的统计信息部分。此外,将数据作为图像发布对于那些愿意提供帮助的人来说几乎是无用的。复制并粘贴为文本(或者理想情况下,dput-ing 以 R 格式的数据)会更有益。

标签: r regression poisson


【解决方案1】:

@thelatemail 认为这更适合 stats.stackexchange.com 可能是正确的,但这里有一些 R 代码。该数据是宽格式的,您需要将其重新构建为长格式。 (并且您不希望包括总计列。将前四列转换为长格式后,您将“职业”和“级别”作为因子类变量,将事故“计数”和“暴露”“月”作为数字列,您可以将此调用用于glm

fit <- glm( counts ~ level + occup + offset(log(months)), data=dfrm, family="poisson")

偏移量需要 log()-ed 以与 poisson-family 的默认链接函数创建的记录计数一致。

(你真的不能指望我们重做那个数据输入任务,现在可以吗?)

【讨论】:

  • + 1 太快了(也许我不应该在回答中去喝咖啡)
  • 谢谢,这很有帮助!!我很抱歉在堆栈交换的错误部分发帖 - 我是新手,但我会确保下次做对。
  • 测试走哪条路是:if ( (theory.content-code.content)/total.content &gt; 0.5) {stats.stackexchange} else { stackoverflow } ...别忘了先搜索一下。
猜你喜欢
  • 2012-07-09
  • 2016-10-22
  • 2018-08-02
  • 2015-05-07
  • 1970-01-01
  • 2017-04-20
  • 1970-01-01
  • 2021-06-03
相关资源
最近更新 更多