
읽은 날짜: 2025년 4월 21일 ~ 4월 27일
유지 보수 작업 지시서 기록에서 파생된 MST(Maintenance short texts)는 텍스트 형식으로 된 정보 기록서이다. 이러한 MST는 제조업에서 의사 결정을 하는데 중요한 역할을 한다. 이 논문에서는 MST에서 5개의 최상위 클래스 PhysicalObject, State, Process, Activity, Property와 224개의 entity와 6개의 relation entity로 구성된 entity 인식 및 추출을 위한 다단계 세분화된 어노테이션 체계인 MaintIE 프레임워크를 제시한다.
제조업에서 객체의 상태 및 유지 관리를 다루는 "엔지니어링 유지 보수"의 특정 영역에서는 특수 데이터 세트 및 모델이 부족하다. 그래서 "유지 보수 작업 지시"(MWO) 기록에서 추출한 단문 텍스트를 MST라고 한다.
MST에서 정보 추출의 중요성은 "누가 무엇을 누구에게, 왜 하는가?"를 해독하는데 달려있다. 그래서 "누가"는 엔지니어링 객체 또는 사람을 지정할 수 있고, "무엇"은 명시적으로 엔지니어링 객체와 관련이 있고, "왜"는 entity에 대한 조치가 필요한 조건 또는 상태를 나타낸다. 이렇듯 정보 추출을 위한 세분화된 체계 및 두 개의 어노테이션 코퍼스인 MaintIE 프레임워크를 제시한다.
MST에 대한 IE(Information Extract)를 다루는 기존 연구는 Named Entity Recognition(NER)에 국한되었다. 이러한 방법은 "Wwho", "what" 및 "why"를 식별할 수 있지만 이러한 텍스트 내의 복잡한 역학 관계에 대한 이해를 제공하지 않는다.
MST에서 IE와 관련해 몇 가지 중요한 과제가 있다.
1. 공개적으로 사용가능한 주석이 달린 IE 데이터 세트가 부족하다.
2. MST와 같은 기술 텍스트에 대한 수동 어노테이션은 비용이 많이 들고 상당한 주제 전문 지식과 암묵적 지식이 필요하다.
3. MST는 언어 품질이 낮아서 텍스트 정규화를 위한 주제 전문 지식이 필요하다. (전처리 필요)
어노테이션 스키마를 설명하고 entity 클래스와 관계를 설명한다.
Table 1. MaintIE 스키마 내의 개체 및 관계에 대한 개요

Figure 1. MaintIE 어노테이션 scheme가 어휘적으로 정규화된 유지 보수 단문 텍스트에 적용된 것을 나타냄
MaintIE의 entity는 PhysicalObject, State, Process, Activity 및 Property의 5가지 상위 클래스로 구성된 3단계에 걸쳐 224개의 개별 entity 클래스를 특징으로 한다.
이 클래스를 나누는 기준은 IEC 81346-2:2019 표준 (IEC, 2019)에 따른다.
MaintIE는 relation에는 mereological, property, type 및 participatory 4가지 관계 class를 제시한다. MaintIE는 폐쇄형 유형 엔티티 집합을 사용하므로 이러한 레이블은 엔티티의 참여를 에이전트, 원인 또는 경험자로 포착하고 상태 변화를 겪거나 작업의 영향을 받는 엔티티를 포착하기 위해 의미적 관계 hasParticipant/ hasAgent 및 hasParticipant/ hasPatient로 변환하여 사용되는 class는 총 6개이다.
Participatory 관계는 Unified Verb Index2를 통해 액세스되는 PropBank (Kingsbury and Palmer, 2002)의 agent (ARG0) 및 patient (ARG1) 레이블을 따른다.
MaintIE에 사용된 dataset에는 중장비, 철도, 광물 처리 및 인프라 산업에서 사용되는 자산에 대한 MWOs에서 무작위로 샘플링된 10,000개의 MSTs가 포함되어 있다.
위에서 언급한대로 MST 텍스트는 어휘 품질이 낮고 약어를 많이 사용하기 때문에 전처리 과정이 필요한데 open source인 LexiClean 방법을 사용했다.
Figure 2. MaintIE 프레임워크
Figure 3. Annotation Process
MWO에서 무작위로 10,000개의 데이터를 sampling한 후 MST로 추출한다. 그러나 MST는 텍스트 길이가 짧음, 오탈자/약어가 다수 존재, 도메인 특화 용어 사용이라는 단점이 있어 LexiClean이라는 어노테이션 도구를 이용해 전처리를 진행한다. 전처리를 진행 후 Entity/Relation 어노테이션 작업을 진행한다.
Entity/Relation 작업은 다음과 같다.
Figure 4. Entity/Relation 작업
수작업으로 도메인 전문가 2명이 직접 어노테이션을 진행 후 F1-score의 일치율을 평가한 후 100% 일치한 1,067건만 골드 표준 데이터셋으로 사용한다. 이 데이터셋은 train dataset으로 사용된다.
Table 2. Summary of entity and relation annotations in the annotated MaintIE corpor.
어노테이션 결과는 위 표와 같다.
Figure 5. Results of automatic information extraction, represented as F1 scores. Bold text indicates theoverall best-performing scores on the 224 entity classes. Underlines indicate the best score for the givenmodel and training strategy. Abbreviations: ER (entity recognition), RE (relation extraction), FG (Fine-Grained Expert-Annotated corpus), and CG (Coarse-Grained Large-Scale corpus).
두 모델인 REBEL과 SpERT를 사용해서 모델을 평가했으며 결과는 다음과 같다.
본 논문에서는 MST의 품질이 낮은 텍스트에서 유의미한 정보를 추출하기 위한 annotation scheme인 MaintIE를 소개했다. 2개의 주석이 달린 코퍼스가 제시되었니다. 224개의 entity 클래스와 6개의 relation으로 구성된 1,076개의 텍스트로 구성된 세분화된 전문가 주석 코퍼스와 5개의 클래스와 6개의 관계로 구성된 7,000개의 텍스트로 구성된 대규모 코퍼스이다.
자동 정보 추출을 위해 이러한 코퍼스를 사용하는 것은 token classification 및 sequence-to-sequence 아키텍처를 사용하여 두 개의 벤치마크 딥러닝 모델을 훈련함으로써 탐구되었다. 최고의 모델은 70% 이상의 micro 및 macro F1-scores를 달성했다.
향후 연구에서는 다른 엔지니어링 분야에 연락하고 세분화된 코퍼스를 활용하여 세분화된 엔티티 및 관계 중심 정보 추출을 개선하기 위한 훈련 전략을 추가로 탐색하여 현재 유지 보수 짧은 텍스트에 없는 엔티티에 대한 데이터 및 주석을 MaintIE 코퍼스에 추가하고자 한다.