Row 4564
Content Data
This page contains data entry 4564 from the Axioma AXP content repository. The structured data below represents the complete record for this entry.
I have image data that is multi labelled (the target class is one hot encoded) that is highly imbalanced like, there are total 29 classes and they are distributed like this [class1': 65528, 'class2: 2089, 'class3: 1588, 'class4': 2162, 'class5': 4089, 'class6': 5794, class7: 1662, 'class8': 2648,'class': 2041, 'class10': 23078, 'class1 1': 3928, 'class12': 6301, 'class1 3': 2121,'class1 4': 16139, 'class15: 547, 'lass16': 6959,'class1 7': 1930, 'class18': 4503, 'class19: 15722, 'class20': 36334, 'class21': 35330, 'class22': 17299, 'class23: 5573, 'class24': 4299, 'class25: 20531,'class26': 8346, 'class27: 29115,'class28': 7757, 'class29; 1925) How can handle this (not fully but to some extent) to train a model. I'm using pytorch. Currently I'm getting Test Metrics: f1_micro: 0.3417 acc: 0.0245 hlm: 0.1316
| Field | Value |
|---|---|
| text | I have image data that is multi labelled (the target class is one hot encoded) that is highly imbalanced like, there are total 29 classes and they are distributed like this [class1': 65528, 'class2: 2089, 'class3: 1588, 'class4': 2162, 'class5': 4089, 'class6': 5794, class7: 1662, 'class8': 2648,'class': 2041, 'class10': 23078, 'class1 1': 3928, 'class12': 6301, 'class1 3': 2121,'class1 4': 16139, 'class15: 547, 'lass16': 6959,'class1 7': 1930, 'class18': 4503, 'class19: 15722, 'class20': 36334,… |
| label | r/pytorch |
| dataType | post |
| communityName | r/pytorch |
| datetime | 2024-04-17 |
| username_encoded | Z0FBQUFBQm5Lakwxb3BybWIxTWZaMWQwSzc3cFhFc212ZVNhNm0tZS05NFFkUGI2SmJlaHozcHhFUlREbmtYbmJEbDZsSHFHNlp6YV80ejQwczdWc2JVU3JxNjlZVkZaY1E9PQ== |
| url_encoded | Z0FBQUFBQm5Lak9GbnR5c0hnd3R1RnJUX2xhWURWcnFpaGUzbHljblR0Q3BKMm9NOVhIVVZPUk5sN1UzREIxZmRKc0hjem1ac3BPekotUmFlcy11ZzFTQ2c4S0pucG5MeXZlUHo4NmlOWU5NTlItX0FGYlhXZkFsN1YxajNMTWxSM05XYkdUV3FoLUdjZVJ5UGJfc1E1SGpTN09zMkFjRFlveGdGUk9IUVRDU09TWmhnTXJ1Z2I0VzdKZ2VaRnFmeDdKRHdFUW51VDVxQ0Yxa1U2dG01aHA3TDlOeUV4WnAyQT09 |
Raw Record
{
"text": "I have image data that is multi labelled (the target class is one hot encoded) that is highly imbalanced like, there are total 29 classes and they are distributed like this [class1': 65528, 'class2: 2089, 'class3: 1588, 'class4': 2162, 'class5': 4089, 'class6': 5794, class7: 1662, 'class8': 2648,'class': 2041, 'class10': 23078, 'class1 1': 3928, 'class12': 6301, 'class1 3': 2121,'class1 4': 16139, 'class15: 547, 'lass16': 6959,'class1 7': 1930, 'class18': 4503, 'class19: 15722, 'class20': 36334, 'class21': 35330, 'class22': 17299, 'class23: 5573, 'class24': 4299, 'class25: 20531,'class26': 8346, 'class27: 29115,'class28': 7757, 'class29; 1925) How can handle this (not fully but to some extent) to train a model. I'm using pytorch. Currently I'm getting Test Metrics:\nf1_micro: 0.3417\nacc: 0.0245\nhlm: 0.1316",
"label": "r/pytorch",
"dataType": "post",
"communityName": "r/pytorch",
"datetime": "2024-04-17",
"username_encoded": "Z0FBQUFBQm5Lakwxb3BybWIxTWZaMWQwSzc3cFhFc212ZVNhNm0tZS05NFFkUGI2SmJlaHozcHhFUlREbmtYbmJEbDZsSHFHNlp6YV80ejQwczdWc2JVU3JxNjlZVkZaY1E9PQ==",
"url_encoded": "Z0FBQUFBQm5Lak9GbnR5c0hnd3R1RnJUX2xhWURWcnFpaGUzbHljblR0Q3BKMm9NOVhIVVZPUk5sN1UzREIxZmRKc0hjem1ac3BPekotUmFlcy11ZzFTQ2c4S0pucG5MeXZlUHo4NmlOWU5NTlItX0FGYlhXZkFsN1YxajNMTWxSM05XYkdUV3FoLUdjZVJ5UGJfc1E1SGpTN09zMkFjRFlveGdGUk9IUVRDU09TWmhnTXJ1Z2I0VzdKZ2VaRnFmeDdKRHdFUW51VDVxQ0Yxa1U2dG01aHA3TDlOeUV4WnAyQT09"
}
Entry Information
- Entry ID: 4564
- Repository: Axioma AXP
- Dataset: arrmlet/reddit_dataset_36
- Total Entries: 100,000