message.log - Was bedeuten diese Einträge?

Berliner31

New Member
Hallo Freunde,

mit meinem Root-Server habe ich seit einiger Zeit Probleme (er hängt sich ab und an auf). Leider habe ich bisher noch nicht herausfinden können woran das liegt.

In der message.log fand ich folgende Einträge. Diese Einträge sagen mir aber leider nichts.

Weiß von euch zufällig jemand was diese Einträge zu bedeuten haben?


Code:
kernel: [22195.104037] EDAC MC0: CE page 0x0, offset 0x0, grain 1073741824, syndrome 0x10, row 6, channel 0, label "": i3200 CE
kernel: [22236.108031] EDAC MC0: CE page 0x0, offset 0x0, grain 1073741824, syndrome 0x10, row 6, channel 0, label "": i3200 CE
kernel: [22266.109146] EDAC MC0: CE page 0x0, offset 0x0, grain 1073741824, syndrome 0x10, row 6, channel 0, label "": i3200 CE
kernel: [22289.108035] EDAC MC0: CE page 0x0, offset 0x0, grain 1073741824, syndrome 0x10, row 6, channel 0, label "": i3200 CE
kernel: [22463.116042] EDAC MC0: CE page 0x0, offset 0x0, grain 1073741824, syndrome 0x10, row 6, channel 0, label "": i3200 CE


Danke und Gruß
Matthias
 
Last edited by a moderator:
Laut https://www.kernel.org/doc/Documentation/edac.txt steht 'CE' für Correctable Errors, also behebbare ECC-Speicherfehler.

Wäre also durchaus denkbar dass hier ein Speicherfehler vorliegt, was die Instabilität des Server erklären könnte (wenn zusätzlich zu den korrigierbaren Fehlern ab und zu nicht-korrigierbare Fehler auftauchen).

Wenn /sys/module/edac_core/parameters/edac_mc_panic_on_ue auf 1 steht würde der Server in dem Falle eines uncorrectable error einen kernel panic auslösen und stehenbleiben (das sieht man dann nur noch an der Konsole).
 
Hallo,

vielen Dank für eure Antworten!

/sys/module/edac_core/parameters/edac_mc_panic_on_ue steht auf 0!

Ob das jetzt am RAM oder einem Treiber liegt, weiß ich leider nicht!

Was mache ich denn jetzt?

Was würdet ihr denn tun?

Danke und Gruß
Matthias
 
Schicke die Log-Auszüge mit Hinweis auf den RAM an deinen Hoster und bitte ihn entweder den RAM zu tauschen oder wenigstens für ein paar Stunden einen memtest darüber laufen zu lassen.
 
Auch euch beiden vielen Dank für eure Antwort!

Ich habe eben gerade, um den RAM zu testen, memtester laufen lassen aber damit ging der load average extrem hoch (auf über 90). Der Server wäre fast abgeschmiert (ich konnte die pid gerade noch so killen).

Ist das normal? (memtester habe ich noch nie genutzt)

Nachtrag:
War mein Fehler! memtester lockt den Rambereich, der getestet wird, ja und daher darf man nicht den gesamten verfügbaren RAM (bei mir 4 GB) testen denn dann stehen anderen Prozessen kein Speicher mehr zur Verfügung (wenn der Server unter Last ist).

Das muss ich mal im "Rescue Mode" machen - das ist bei meinem Serveranbieter praktisch eine automatische Live-CD von der gebootet wird). Das muss ich mal spät nachts machen wenn kein Traffic auf dem Server ist.
 
Last edited by a moderator:
memtest sollte als einziges Programm ausgeführt werden, ohne Linux, dass ist aber von CD oder speziellem Bootloader möglich.

Und was brachte jetzt der längere memtest?
Defektes RAM?
 
Last edited by a moderator:
Tja .... habe eben mit meinem CMS Daten importiert und dann ist der Server wieder abgeschmiert.

Rescue-Mode gestartet und fsck -p /dev/sda3 ausgeführt - diesmal - kein Fehler gefunden.

Danach memtester (ich habe 4 GB RAM)!

Code:
memtester 4096 3                                        :(
memtester version 4.3.0 (64-bit)
Copyright (C) 2001-2012 Charles Cazabon.
Licensed under the GNU General Public License version 2 (only).

pagesize is 4096
pagesizemask is 0xfffffffffffff000
want 4096MB (4294967296 bytes)
got  3753MB (3935555584 bytes), trying mlock ...[1]    12763 killed
abgebrochen


Code:
memtester 3754 3                                                                                     :(
memtester version 4.3.0 (64-bit)
Copyright (C) 2001-2012 Charles Cazabon.
Licensed under the GNU General Public License version 2 (only).

pagesize is 4096
pagesizemask is 0xfffffffffffff000
want 3754MB (3936354304 bytes)
got  3754MB (3936354304 bytes), trying mlock ...[1]    12780 killed
abgebrochen

Code:
memtester 3072 3                                                                                     :(
memtester version 4.3.0 (64-bit)
Copyright (C) 2001-2012 Charles Cazabon.
Licensed under the GNU General Public License version 2 (only).

pagesize is 4096
pagesizemask is 0xfffffffffffff000
want 3072MB (3221225472 bytes)
got  2728MB (2860662784 bytes), trying mlock ...[2]    12797 killed
abgebrochen

Code:
memtester 2048 3                                                                                     :(
memtester version 4.3.0 (64-bit)
Copyright (C) 2001-2012 Charles Cazabon.
Licensed under the GNU General Public License version 2 (only).

pagesize is 4096
pagesizemask is 0xfffffffffffff000
want 2048MB (2147483648 bytes)
got  2048MB (2147483648 bytes), trying mlock ...locked.
  Random Value        : ok
  Compare XOR         : ok
  Compare SUB         : ok
  Compare MUL         : ok
  Compare DIV         : ok
  Compare OR          : ok
  Compare AND         : ok
  Sequential Increment: ok
  Solid Bits          : ok
  Block Sequential    : ok
  Checkerboard        : ok
  Bit Spread          : ok
  Bit Flip            : ok
  Walking Ones        : ok
  Walking Zeroes      : ok
  8-bit Writes        : ok
  16-bit Writes       : ok

echo $?
0 (alles ok)

Hmmm ... ich bin mit meinem Latein am Ende.

Jemand eine Idee?
 
Einen sinnvollen memtest kann man nur offline, sprich ohne gebootetes Betriebssystem machen. Denn den Kernelspeicher oder DMA-Bereiche können sonst nicht getestet werden.
Und im Zweifel: Sage deinem Hoster dass da was mit Mainboard oder RAM nicht stimmt und du gerne neue Hardware hättest (oder zumindest mal einen RAM-Test durch den Hoster haben willst).
Alles andere bringt dich nicht weiter.
 
Back
Top